Investigadores documentan la avalancha de citas y reseñas inventadas por IA en congresos de visión por computador

Fuentes: Q&A from the slop trenches

Dos revisores de congresos de inteligencia artificial y visión por computador documentan este verano el alcance de lo que denominan las "trincheras del slop": el trabajo de lidiar con envíos generados por modelos de lenguaje. En conjunto, revisaron 22 artículos repartidos entre NeurIPS, WACV y el taller TerraBytes de la ECCV, y encontraron que 15 de ellos (el 68 %) contenían citas inventadas, listas de autores falsificadas para artículos reales o texto claramente generado por IA, con porcentajes que llegaron al 82 % en una de las dos cuentas individuales.

El fenómeno no es aislado. Un análisis publicado en Nature cifró en decenas de miles las publicaciones de 2025 con referencias probablemente inválidas, y otra auditoría sobre arXiv, bioRxiv, SSRN y PubMed Central estimó cerca de 146.900 citas alucinadas solo en 2025, repartidas de forma diluida entre muchos artículos y más frecuentes entre investigadores jóvenes y equipos pequeños. En biomedicina, The Lancet detectó que la proporción de artículos con al menos una referencia fabricada se multiplicó por seis en dos años, pasando de uno de cada 2.828 en 2023 a uno de cada 458 en 2025. El problema también afecta al otro lado: Pangram calculó que el 21 % de las reseñas de ICLR 2026 estaban completamente generadas por IA, e ICML 2026 detectó cerca de 800 reseñas escritas por revisores que se habían comprometido a no usar modelos de lenguaje.

Los autores describen casos concretos —autores reales reemplazados por nombres ficticios casi verosímiles, artículos de 53 páginas con jerga inventada— y comparten una herramienta de auditoría bibliográfica para ayudar a otros revisores a detectar citas falsas antes de invertir horas en el trabajo.