llms.txt en 2026: qué dicen los datos y por qué conviene publicarlo igualmente

Fuentes: llms.txt in 2026: what the data shows and why you should still ship one

llms.txt es una propuesta comunitaria —no un estándar formal— consistente en un archivo Markdown en la raíz del sitio que enumera las páginas más importantes para que los sistemas de inteligencia artificial sepan qué leer primero. Aunque la mayoría de análisis lo presentan como imprescindible, los datos disponibles en 2026 muestran que su utilidad real para las citaciones en IA es limitada.

Un estudio de SE Ranking sobre 300.000 dominios sitúa la adopción en torno al 10,13 %, y entre los cincuenta dominios más citados por IA solo uno dispone del archivo. Un análisis de Limy.ai sobre más de 500 millones de eventos de bots en 90 días registró apenas unos cientos de peticiones directas a /llms.txt: rastreadores como GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot y Google-Extended siguen prefiriendo el HTML. Google ha confirmado a través de Gary Illyes que no lo utiliza ni planea hacerlo, y John Mueller lo ha comparado con la desacreditada etiqueta meta keywords; su documentación de IA generativa de 2026 lo incluye entre las tácticas innecesarias. Ningún proveedor importante se ha comprometido públicamente a leerlo en producción, y el Web Almanac 2025 de HTTP Archive estima que alrededor del 40 % de los archivos publicados son valores por defecto generados por plugins.

Aun así, publicarlo resulta razonable. Su coste es casi nulo —unos veinte minutos—, sirve como ejercicio de auditoría al obligar a describir las páginas clave, y puede funcionar como superficie de comunicación con agentes automatizados. Para que sea útil, conviene servirlo en text/plain en la ruta exacta /llms.txt, con URLs absolutas, una selección curada de entre diez y cuarenta páginas relevantes, una fecha de última revisión y, si se publica una copia en Markdown del contenido, mantenerla fuera del sitemap para evitar contenido duplicado. Para saber si algún bot lo lee, se pueden filtrar los registros de acceso por usuario-agente o incrustar una URL única a modo de honeypot. La prioridad real sigue siendo asegurar el acceso de los rastreadores, estructurar las respuestas y aportar datos originales antes que dedicar tiempo a este archivo.