Cloudflare lanza opción para bloquear entrenamiento de IA sin perder visibilidad en búsqueda

Fuentes: Cloudflare introduces Disallow AI Training to separate search indexing from AI model training

Cloudflare ha anunciado la introducción de una nueva configuración llamada 'Disallow AI Training', que permite a los propietarios de sitios web mantener su contenido indexado para búsquedas tradicionales mientras se niegan a que los rastreadores de IA utilicen sus datos para entrenar modelos. Esta herramienta resuelve la dificultad histórica de elegir entre permitir el entrenamiento de IA o perderse en los resultados de búsqueda, un dilema que existía porque los grandes operadores utilizaban rastreadores de uso mixto que servían para ambos fines simultáneamente.

La nueva opción se basa en la publicación de una preferencia en el archivo robots.txt, identificando al rastreador y clasificando su intención. Cloudflare ha designado a Apple, Google y Microsoft como 'Accountable' por cumplir con requisitos de transparencia y control granular. Esta iniciativa busca evitar que los propietarios de sitios, que dependen de la publicidad o suscripciones, pierdan tráfico al bloquear completamente a los rastreadores de IA, ya que el 17% de los sitios en Cloudflare ya bloquea el entrenamiento de IA, pero menos del 1% bloquea la búsqueda.

El sistema introduce controles más precisos: 'Allow', 'Disallow AI Training', 'Block on pages with ads' y 'Block'. La opción 'Disallow AI Training' permite a los rastreadores de uso mixto (como Applebot, Bingbot y Googlebot) continuar con la búsqueda sin afectar a la indexación. Además, se deprecia la configuración 'Block AI Bots' a favor de controles específicos para búsqueda, entrenamiento y agentes. Los clientes existentes mantendrán sus configuraciones actuales, pero se migrarán a este nuevo sistema de preferencias.