La amenaza creciente del scraping masivo contra la web abierta

Fuentes: An update on the scraper situation

LWN.net actualiza el balance sobre la oleada de scraping masivo que golpea sitios web en busca de datos para entrenar modelos de lenguaje. Más de un año después de su primer informe, el problema se ha intensificado: ataques coordinados desde millones de direcciones IP únicas en pocas horas, con user-agents falsificados y sin descargar imágenes ni CSS, hacen casi imposible bloquearlos de forma efectiva.

El tráfico procede en su mayoría de redes residenciales y móviles controladas por software instalado sin consentimiento del usuario, conocidas como "proxies residenciales". Los operadores se dividen en dos tipos: redes criminales que difunden malware (como la botnet IPIDEA, desmantelada por Google a principios de 2025, cuya caída redujo temporalmente el tráfico en LWN) y empresas que operan a cara descubierta, como Bright Data, que ofrece VPNs gratuitas a cambio de convertir el dispositivo del usuario en un nodo de ataque. También se han identificado dispositivos de streaming multimedia comprometidos como vectores habituales.

Las grandes compañías de IA también scrapean, pero suelen identificarse en el user-agent y respetar robots.txt; no generan el volumen masivo de los proxies residenciales. No hay pruebas de que contraten esas redes, aunque el autor señala que sería esperable dada su opacidad sobre el origen de los datos de entrenamiento. Además de los modelos comerciales, existen muchos proyectos encubiertos de gobiernos, organizaciones criminales y empresas que persiguen una ventaja en la carrera armamentística de la IA.

Los sitios web han respondido con herramientas como Anubis (proof-of-work), captchas visuales, muros de login o incluso envenenamiento de datos con herramientas como iocaine. LWN asegura haber resistido su mayor ataque hasta la fecha gracias a defensas que mantiene en secreto, en una carrera paralela a la de los atacantes.