Estas continuas dependencias de soluciones en sistemas que interconectan nuestra sociedad nos hacen preguntarnos dónde aplicar ciertas tecnologías y dónde se necesitan bases robustas que no den espacio a una caída encadenada.
Las caídas de servicios en la última década han estado relacionadas con sistemas que, en procesos de actualización, han generado fallos que: dificultan en sus inicios la identificación por falta de centralización y gobierno de datos, han tenido caídas súbitas de servicio por componentes o simplemente se sobrecargan. Estas situaciones han develado la importancia de preguntarnos y asegurarnos, en el caso de las compañías que prestamos o dependemos de sistemas operativos base o de plataformas completas para operar: ¿realmente están a salvo nuestros servicios y la garantía de la prestación de estos para nuestros clientes?
¿Cómo encontrar la estabilidad en un mundo interconectado?
Desde nuestra experiencia en el desarrollo de sistemas para soportar procesos de misión crítica, procesos de tecnología que suponen el mantener una disposición completa de recursos en línea, respuestas en milisegundos y garantizar el consumo y envío de información alrededor del mundo con el aval de reenlace si se presenta alguna anomalía, hemos entendido que para garantizarlo no es posible basarse en sistemas incompletos, dependientes de demasiados componentes para operar, que son blanco constante de vulneraciones, ataques, errores, o posibles decodificaciones, que al realizar una actualización generen riesgo en la operación de una o múltiples compañías.
Es desde esta perspectiva que encontramos la respuesta en una plataforma que nos garantizó la integración en un solo punto de los componentes necesarios para misión crítica con alta concurrencia, redundancia y la capacidad de soporte de altas cargas transaccionales, que a la fecha le ha brindado a nuestros clientes y a nuestra compañía la tranquilidad de no exponer su negocio a caídas súbitas, vulneraciones o saturaciones.
Sobre lo anterior, también desarrollamos una serie de recomendaciones de procesos que adoptamos y que evitan este tipo de fallos a nuestros clientes:
Tenga en cuenta plataformas que posibiliten la integración de recursos en un punto y que, así mismo, no tengan dependencias externas que puedan abrir la puerta a más riesgos que no puede controlar directamente. La integración de las capacidades necesarias en un único punto para misión crítica no solo le permitirá tener una simplificación, le otorga centralización de responsabilidad y gobierno de datos, además de autonomía y escalabilidad.
Los sistemas o servicios a implementar deben tener un soporte de garantía, esto a través de la comprobación de los escenarios en su aplicación, producción y evolución. Un sistema que no se prueba, comprueba y analiza es un sistema en riesgo de fallo.
La dinámica de consumo de servicios en línea puede variar por diferentes motivos e incluso por factores externos, que intensifiquen o minimicen la demanda de servicios en línea. Por ello, es necesario tener un monitoreo constante de la transaccionalidad, consumo y respuesta de los sistemas que nos permita entender la sanidad y respuesta. Así mismo, el esquema de alertas debe indicarnos cualquier anomalía en disponibilidad, consumo y tiempos de respuesta de un sistema, transacción o nuestros recursos tecnológicos que permitan detectar tempranamente y generar ajustes inmediatos en la operación.
Garantizar la disponibilidad de recursos es fundamental, así como el continuo procesamiento y activación de procesos que permitan tener una maximización de recursos, herramientas como el balanceo de carga, infraestructura activo / activo y la replicación de datos son aliados indispensables en procesos de misión crítica para la tranquilidad de los usuarios y consumidores de nuestras plataformas.
Así como se maximiza el uso en producción, es necesario garantizar un crecimiento de los recursos de infraestructura que permitan sustentar el crecimiento en la carga tanto en el consumo de CPU, memoria o servidores en línea.
Aplicar las actualizaciones de sistema y parches de seguridad es importante y recomendado siempre y cuando estén probados, desde esta perspectiva y dados los recientes casos, realizar estas actualizaciones en un esquema de canary deployment en sistemas activo-activo pueden evitar que la aplicación de una actualización o parche fallen. A pesar de que no se ha presentado el caso en sistemas operativos IBM siempre probar y comprobar es una estrategia que no falla.
Un sistema operativo robusto, que no tenga fallos de seguridad es importante al momento de definir si ser seleccionado o no, recomendamos siempre que este factor sea fundamental ya que múltiples sistemas que parecen ser muy accesibles a tendencias resultan ser también muy accesibles a las vulneraciones. Adicionalmente, recomendamos integrar siempre un esquema de cifrado end-to-end donde se de aplicación a los esquemas más sólidos de cifrado como AES y otros recomendados desde PCI y NIST, que aseguren los datos sensibles y la interoperabilidad de los datos sin riesgo.
Para nosotros como compañía es importante transferir confianza y compartir este conocimiento para el entorno de consumo de datos IoT asi como el PoT, debido a la alta dependencia que nuestra economía tiene en el día a día sobre la tecnología que facilita y agiliza nuestras operaciones diarias.
Si desea conocer más información o asesorarse sobre cómo garantizar un ecosistema de misión crítica redundante y disponible continuamente, déjenos sus datos a continuación, pronto le contactaremos.