Un año combatiendo bots en un sitio de 1,5 millones de páginas: qué funcionó

Un año combatiendo bots en un sitio de 1,5 millones de páginas: qué funcionó Nick Gray, creador de PatronView, una base de datos de filántropos estadounidenses construida a partir de formularios fiscales IRS 990 y documentos públicos, ha documentado durante un año una batalla silenciosa contra una

La SEC bloquea el tráfico de bots no declarados en su sitio web

La Comisión de Bolsa y Valores de Estados Unidos (SEC) está limitando las solicitudes que llegan a SEC.gov desde herramientas automatizadas no declaradas. El organismo justifica la medida en la necesidad de garantizar un acceso equitativo a todos los usuarios y proteger el rendimiento del servicio p

ShieldFont: cómo un tipo de letra protege tus textos del entrenamiento de IA

ShieldFont: la tipografía que sabotea el entrenamiento de IA sin que el lector lo note En un contexto de creciente tensión entre creadores de contenido y empresas de inteligencia artificial, ShieldFont propone una solución técnica tan ingeniosa como controversial: alterar las palabras que ve una má

«Buscar en Google» suena anticuado: la nueva generación ya dice «búscalo»

El contenido proporcionado no contiene el artículo periodístico, sino exclusivamente un aviso legal de The New York Times relativo a los términos de servicio del sitio. En él se prohíben la minería de datos, el raspado automatizado y el uso de cualquier material —incluidos textos, datos y archivos e

La mayoría de los Googlebot que ves son bots falsos

Cuando un webmaster observa en sus registros una avalancha atribuida al rastreador Googlebot, lo habitual es confiar en la cabecera HTTP que dice ser ese bot. Sin embargo, esa cabecera es una identificación voluntaria que cualquiera puede falsificar. Un reciente hilo en Hacker News recoge testimonio

Editores amenazan con dejar Google tras una caída de tráfico superior al 40%

Varios editores estadounidenses están planteándose bloquear por completo el acceso de Google a sus sitios web ante el desplome del tráfico derivado de sus búsquedas. Según datos de Semrush recogidos por The Wall Street Journal, algunas publicaciones perdieron más del 40% del tráfico entre junio de 2

Reddit cierra el acceso sin cuenta en su antigua interfaz para frenar el scraping

Reddit ha empezado a exigir iniciar sesión para usar old.reddit.com, su frontend clásico basado en HTML, según anunció en un mensaje a los moderadores. La compañía justifica la medida porque la experiencia sin login en esa versión es, según afirma, una fuente significativa de scraping abusivo y tráf

El colapso de TheNumbers.com expone la fragilidad de la web ante los bots de IA

TheNumbers.com, una de las bases de datos más fiables de la industria cinematográfica con 78.000 películas y 236.000 personas registradas, cayó el 5 de marzo de 2026 tras un ataque combinado de tráfico automatizado. Fundada en 1997 por el ex desarrollador de IBM Bruce Nash, la web recibía alrededor

¿A quién detiene realmente Anubis?

Anubis es un proxy HTTP con prueba de trabajo (proof-of-work) pensado para frenar a los bots de inteligencia artificial y a los raspadores web antes de servir el contenido. El programador Farid Zakaria lo describe como un «impuesto regresivo» que apenas incomoda a sus adversarios reales y, en cambio

La amenaza creciente del scraping masivo contra la web abierta

LWN.net actualiza el balance sobre la oleada de scraping masivo que golpea sitios web en busca de datos para entrenar modelos de lenguaje. Más de un año después de su primer informe, el problema se ha intensificado: ataques coordinados desde millones de direcciones IP únicas en pocas horas, con user

El robots.txt de los grandes sitios, escrito para una guerra que ya terminó

El archivo robots.txt fue ideado como un libro de reglas para regular el rastreo de la web. Casi cuatro años después del lanzamiento de GPTBot, un análisis del top 10.000 sitios revela que ese libro de reglas se quedó fijo en la guerra de 2023: la del crawler de entrenamiento de OpenAI. Del 38% de s

Anubis: un escudo con prueba de trabajo contra el scraping masivo de IA

Anubis: el escudo con prueba de trabajo que se interpone entre los usuarios y el scraping masivo de IA Cada vez más administradores de sitios web están levantando una barrera digital ante el avance indiscriminado de los rastreadores de inteligencia artificial. Se llama Anubis y, a diferencia de los

Un rastreador que pedía archivos .git/config cae en una web trampa

El desarrollador detrás del generador web infinito bork.php detectó en sus registros de Apache un pico inusual de peticiones dirigidas al archivo /.git/config, asociado al sistema de control de versiones Git. El autor había modificado su programa en noviembre para devolver respuestas falsas y aleato

La amenaza silenciosa de los proxies residenciales

Los proxies residenciales —redes de dispositivos domésticos usados como nodos de salida para enrutar tráfico web— se han convertido en una pieza clave del ecosistema de scraping, del entrenamiento de modelos de IA y, cada vez más, de la ciberdelincuencia. Funcionan porque los sitios web bloquean con

El Smart TV de tu salón, nodo del raspado web para IA

Include Security ha publicado un informe que documenta el SDK de Bright Data, un software integrado en aplicaciones de terceros que convierte teléfonos y, sobre todo, televisores inteligentes en nodos de una red de proxy residenciales utilizada para alimentar el raspado web destinado al entrenamient

Codeberg publica un repositorio cebadero para confundir a los 'scrapers' de IA

Un repositorio alojado en la plataforma de código abierto Codeberg funciona como cebadero (honeypot) dirigido a los rastreadores web empleados por sistemas de inteligencia artificial. Su propósito declarado es disuadir a los operadores de estos bots y contaminar los corpus de entrenamiento con datos

Amazonbot comenzará a respetar robots.txt a partir de junio de 2026

Amazon ha anunciado que su bot de rastreo web Amazonbot comenzará a respetar el archivo robots.txt a partir del lunes 15 de junio de 2026. La compañía envió una comunicación a editores informándoles que las preferencias de rastreo se gestionarán únicamente a través de las directivas estándar de la i

Subrutinas: IA automatiza web sin costos extra

Una nueva técnica llamada 'Subrutinas' está automatizando tareas web al ejecutar scripts directamente dentro de las pestañas del navegador, resolviendo un problema común en la automatización con LLMs. La mayoría de los agentes de IA fallan al intentar realizar tareas repetitivas debido a los costos

Sitios web usan 'Anubis' contra scraping de IA

Sitios web están implementando una nueva herramienta llamada 'Anubis' para combatir el scraping masivo de datos por parte de empresas de inteligencia artificial. La medida, que ya se está viendo en varios sitios, busca proteger los servidores de la sobrecarga que causan estos 'scrapers', lo que pued

Herramienta web facilita el análisis de indultos presidenciales

## Hacker News: Un Explorador de Indultos Presidenciales con Playwright, SQLite y Astro El proyecto descrito es una aplicación web creada para facilitar la investigación y verificación de indultos presidenciales. Inspirado en el trabajo de Liz Oyer (probablemente una investigadora o periodista que

Anubis: Web lucha contra la extracción de datos por IA

Anubis: la creciente batalla de los sitios web contra la extracción masiva de datos por parte de empresas de inteligencia artificial El fenómeno del scraping agresivo llevado a cabo por compañías de inteligencia artificial ha alcanzado niveles sin precedentes, provocando caídas de servicio en numer

Sitio científico usa mensaje de disculpa contra bots

El mensaje "We apologize for the inconvenience..." que aparece en iopscience.iop.org (la plataforma de publicación de la IOP Publishing, una importante editorial científica) es una medida de seguridad implementada para proteger el sitio web de ataques automatizados, específicamente de bots y crawler

CPNs: Herramienta para IA y Apps Distribuidas

Este artículo explora el uso de Redes de Petri Coloreadas (CPNs) como una herramienta prometedora para desarrollar aplicaciones distribuidas concurrentes, especialmente en el contexto de la inteligencia artificial generativa (LLMs) y el desarrollo de software. El objetivo principal es mejorar la ver