Cloudflare, las verdaderas causas detrás del apagón global de Internet

Foto del autor

By Rita Ora

Llamarada de nube arrojar luz sobre apagón globaly que el 18 de noviembre dejó fuera de línea numerosos sitios web en todo el mundo. En una extensa publicación publicada después del incidente, el director ejecutivo Matthew Prince admitió que, en las primeras etapas, la empresa había sospechado de un ataque masivo. DDoS. Una teoría plausible teniendo en cuenta la naturaleza de los servicios ofrecidos, pero que se demostró incorrecta unas horas más tarde.

Los hackers no tienen nada que ver con eso.

No fue un ciberataque ni una acción maliciosa”, explicó Prince, aclarando que el problema surgió de una cambio interno en el sistema de permisos de bases de datos. Un cambio que provocó un error inesperado en uno de los componentes cruciales del sistema: el archivo utilizado por el módulo Bot Management, responsable de clasificar y gestionar las solicitudes automatizadas en los sitios de los clientes de Cloudflare.

Ese archivo, que se actualiza automáticamente cada pocos minutos, contiene las características utilizadas por el modelo de aprendizaje automático para determinar si un bot debe considerarse legítimo o bloqueado. Debido al cambio en el sistema que genera ese archivo, su tamaño cambió repentinamente, lo que llevó al sistema a regresar error HTTP 5xxbloqueando o degradando gran parte del tráfico global manejado por la plataforma.

Un sistema frágil

El papel del sistema de gestión de bots es hoy particularmente delicado. Cada vez más empresas lo utilizan para evitar que los rastreadores automatizados utilicen contenido web para entrenar modelos lingüísticos sin permiso. No es casualidad que Cloudflare haya iniciado un proyecto llamado “pago por rastreo”, con el objetivo de permitir que las plataformas de inteligencia artificial accedan al contenido solo pagando una tarifa.

El incidente fue definido por el propio consejero delegado como «el peor desde 2019», año del último apagón que afectó a la empresa. Cloudflare, que maneja una parte importante del tráfico global, confirmó que los servicios volvieron a funcionar después de identificar y resolver la causa de la falla. Mientras tanto, Prince prometió que la empresa llevará a cabo más controles internos para garantizar que un evento similar nunca vuelva a ocurrir.