Los administradores de git.kernel.org revelan que los rastreadores de inteligencia artificial generan una carga de sistema masiva, consumiendo permanentemente el 20% de su capacidad total de procesamiento. Según los datos proporcionados, en cualquier momento dado, entre 14 y 16 núcleos CPU de sus cinco nodos geodistribuidos se dedican exclusivamente a renderizar commits como HTML para estos bots, superando el tráfico legítimo de clonaciones git.
El problema radica en la ineficiencia de los rastreadores: en lugar de clonar los repositorios, que es el método más eficiente y gratuito, los bots scrapers acceden a miles de millones de URLs válidas para obtener duplicados de los mismos 1.48 millones de commits del kernel de Linux. Esta estrategia genera un volumen de peticiones abrumador, con aproximadamente 6 millones de solicitudes diarias, de las cuales el 33% logra evadir los mecanismos de protección actuales.
Aunque se implementó Anubis, un sistema de desafíos criptográficos para frenar a los bots, estos han aprendido a resolverlos. Actualmente, solo el 2% del tráfico es considerado legítimo bajo supuestos conservadores. Ante la falta de soluciones simples y la amenaza de colapsos por picos de tráfico, el equipo técnico está desactivando funcionalidades y restringiendo acciones costosas para usuarios anónimos, priorizando la estabilidad del servicio frente a la extracción masiva de datos para modelos de aprendizaje automático.
