GitHub sufrió el 17 de agosto una interrupción de 7 horas y 47 minutos que afectó a github.com, la autenticación, Actions, las API, las pull requests, los issues y Copilot. La compañía atribuye el incidente a un pico de tráfico que desbordó un componente crítico de infraestructura en su centro de datos de la región central de Estados Unidos; la presión de capacidad se propagó por el sistema y provocó fallos de autenticación en cascada. Algunos servicios de Copilot tardaron más en recuperarse y generaron un bucle de reintentos en el lado cliente que retrasó la restauración completa.
El CTO Vladimir Fedorov, que firma el comunicado, enmarca la caída como el segundo incidente grave del mes, tras el fallo de Actions del 6 de agosto, y la vincula al fuerte crecimiento de uso: los commits mensuales han pasado de 1.400 millones en abril a 2.900 millones en agosto. Desde abril, GitHub ha incorporado más de 3 millones de núcleos de CPU, 120 petabytes de almacenamiento de alta velocidad y nueva capacidad de red, y ha acelerado la migración a Azure, que ya soporta el 58 % de la carga de la plataforma, frente al 12 % de mayo.
La compañía anuncia nuevas medidas técnicas: límites de reintentos uniformes para evitar tormentas de peticiones, revisión de alertas de CPU y memoria, aislamiento de sistemas críticos y eliminación de dependencias compartidas, además de un nuevo diseño de arquitectura para escalar lecturas de forma lineal en los monorepos más grandes.
