¿Qué es El apagón de CrowdStrike?
El 18 de julio de 2024, una actualización de configuración provocó El apagón de CrowdStrike para sistemas Windows, esto significó una interrupción a nivel global. Esta actualización del sensor de configuración, que es parte de la plataforma Falcon, causó un error lógico que resultó en pantallas azules de la muerte en los sistemas afectados. La actualización problemática se lanzó entre las 04:09 UTC y las 05:27 UTC del 19 de julio, afectando principalmente a las versiones 7.11 y superiores del antivirus Falcon para Windows.
El problema no fue causado por un ciberataque, sino por un error en la lógica de la actualización del archivo de configuración, específicamente en el archivo de canal 291 dentro del sistemas Windows. El impacto fue amplio, afectando aproximadamente a 8.5 millones de dispositivos Windows y causando interrupciones en múltiples sectores, incluyendo aeropuertos y empresas globales como bancos, hospitales y de telecomunicaciones.
¿Este update afectó la nube de Microsoft Azure?
La nube de Microsoft Azure fue afectada por el error de CrowdStrike. El problema impactó a muchas máquinas virtuales en Azure que estaban ejecutando el antivirus Falcon de CrowdStrike en Windows. Microsoft ha trabajado estrechamente con CrowdStrike para desarrollar soluciones y ofrecer soporte técnico a los clientes afectados. Se han proporcionado guías para la remediación manual y scripts para ayudar a restaurar los sistemas afectados.
Aunque los servicios de Azure comenzaron a recuperarse, Microsoft 365 experimentó una «condición degradada» con muchos servicios permaneciendo inactivos o funcionando a un rendimiento reducido. Esto afectó a herramientas críticas como Outlook, Teams y SharePoint, que son esenciales para la comunicación y colaboración empresarial.
Afectación de vuelos internacionales
Los vuelos internacionales se vieron afectados debido a la interrupción causada por el update de CrowdStrike que provocó pantallas azules de la muerte (BSOD) en los sistemas operativos Windows. Esta interrupción afectó a sistemas críticos utilizados en los aeropuertos y por las aerolíneas, incluidos los sistemas de registro de pasajeros, gestión de vuelos y comunicaciones:
- Sistemas de Aeropuertos: Muchos aeropuertos dependen de sistemas Windows para operar sus redes internas y gestionar funciones críticas como la asignación de puertas, control de tráfico aéreo y sistemas de seguridad. La interrupción causada por los BSOD impidió que estos sistemas funcionaran correctamente, lo que resultó en retrasos y cancelaciones de vuelos
- Sistemas de Aerolíneas: Las aerolíneas utilizan sistemas Windows para tareas como la emisión de boletos, registro de pasajeros y gestión de equipaje. La interrupción afectó la capacidad de las aerolíneas para procesar estos servicios de manera eficiente, lo que causó una cascada de problemas operativos que llevaron a retrasos y cancelaciones
- Coordinación Internacional: La interrupción en múltiples sistemas a nivel mundial significó que los problemas no se limitaron a una región específica. La falta de funcionalidad en los sistemas de comunicación y gestión de vuelos afectó la coordinación internacional, exacerbando los problemas y causando una disrupción significativa en los horarios de los vuelos.
Afectación en hospitales y empresas de telecomunicaciones.
El error de CrowdStrike también afectó a hospitales y empresas de telecomunicaciones:
- Hospitales: El impacto en los hospitales varió considerablemente. Algunos hospitales experimentaron interrupciones significativas en sus sistemas de tecnología médica, comunicaciones y proveedores de servicios externos, lo que resultó en retrasos, desvíos o cancelaciones de procedimientos clínicos. Otros hospitales informaron de un impacto mínimo o nulo, utilizando sistemas de respaldo en papel y llamadas telefónicas para mantener la atención al paciente mientras se solucionaban los problemas tecnológicos.
- Empresas de Telecomunicaciones: Las empresas de telecomunicaciones también se vieron afectadas, ya que muchos de sus sistemas dependen de la Infraestructura de Microsoft y de soluciones de seguridad como las proporcionadas por CrowdStrike. La interrupción causó problemas en la red y en los servicios de soporte al cliente, lo que afectó la capacidad de las empresas para gestionar operaciones y mantener la comunicación efectiva con sus usuarios.
¿La afectación fue a nivel mundial?
El error de CrowdStrike que afectó los sistemas de Microsoft Windows tuvo un impacto significativo a nivel mundial, afectando a diversas regiones y sectores. Las áreas más afectadas incluyeron principalmente Asia y Europa, seguidas por América y Oceanía. En China, el impacto fue limitado en los servicios clave debido a su enfoque en la autosuficiencia tecnológica, mientras que Rusia e Irán no reportaron interrupciones importantes debido a las sanciones que les impiden utilizar servicios de alta tecnología estadounidenses.
El impacto se extendió a diversos sectores, incluyendo hospitales, empresas de telecomunicaciones y el sector aéreo. Los hospitales en el Reino Unido experimentaron interrupciones significativas, aunque en otras regiones como Atlanta, las interrupciones fueron menores. Empresas de telecomunicaciones en varios países también reportaron problemas debido a la interrupción de servicios críticos.
La interrupción afectó gravemente a los vuelos internacionales, con la cancelación de más de 5,000 vuelos a nivel mundial. Aeropuertos en Australia, Nueva Zelanda, Hong Kong y otros lugares experimentaron demoras y cancelaciones, afectando a miles de pasajeros
¿Cómo se pudo haber evitado?
Evitar el error de CrowdStrike que afectó a los sistemas Microsoft Windows hubiera sido posible con varias medidas preventivas y de gestión de riesgos:
- Pruebas Exhaustivas: Antes de lanzar una actualización de software, es crucial realizar pruebas exhaustivas en diferentes entornos y escenarios. CrowdStrike podría haber identificado el error lógico que causó los fallos si se hubieran implementado pruebas más rigurosas.
- Implementación Gradual: Desplegar actualizaciones de forma gradual permite identificar problemas en una fase temprana sin afectar a todos los usuarios simultáneamente. Una implementación escalonada podría haber limitado el alcance del impacto.
- Monitoreo en Tiempo Real: Un sistema de monitoreo robusto que detecte anomalías y problemas en tiempo real podría haber alertado a CrowdStrike sobre el fallo de manera más rápida, permitiendo una respuesta y corrección más inmediata.
- Plan de Respuesta a Incidentes: Tener un plan de respuesta a incidentes bien definido y probado asegura que una organización pueda reaccionar rápidamente ante problemas imprevistos, minimizando el impacto en los usuarios.
- Colaboración con Clientes y Socios: Mantener una comunicación abierta y continua con los clientes y socios clave (como Microsoft) puede ayudar a identificar y resolver problemas más rápidamente. En este caso, la colaboración con Microsoft fue fundamental para mitigar el impacto, pero una colaboración más proactiva desde el inicio podría haber evitado el problema.
- Redundancia y Resiliencia: Asegurarse de que existen sistemas de respaldo y redundancia puede minimizar el impacto de fallos en los sistemas primarios. La resiliencia en la infraestructura tecnológica es clave para mantener la continuidad operativa en caso de interrupciones.
Seguramente el error de CrowdStrike cambiara la forma de pensar de muchas empresas respecto a la resiliencia de TI, su tolerancia a fallos y su plan de recuperación ante una incidencia global, esperemos que esta entrada y este incidente logre tomar conciencia dentro de los procesos informático de las empresas.


