Un texto generado por IA es detectado como humano tras su reescritura

Fuentes: Hand-written rewrite of AI text evades detection tools

Un análisis reciente demuestra que la reescritura manual de un texto generado por inteligencia artificial puede evadir los detectores de IA, un hallazgo que desafía la fiabilidad de las herramientas actuales. El estudio parte de la controversia generada por la herramienta Pangram, que identificó erróneamente como 100% artificial un tweet de David Sacks, lo que llevó a la empresa a publicar un paper explicando su metodología. Pangram utiliza un modelo de lenguaje para crear datos de entrenamiento a partir de textos humanos conocidos, generando nuevas variaciones y detectando patrones de coautoría. La herramienta afirma tener una tasa de falsos positivos del 0,0041% y una tasa de detección de IA del 0,34%.

Para probar la robustez de estos detectores, el autor utilizó el modelo Opus 5 para reescribir un tweet sobre la 'pacing the frontier' (moderación del desarrollo de IA) basado en declaraciones de Dario Amodei y Sam Altman. El texto generado por la IA fue luego reescrito a mano, manteniendo la estructura y las ideas originales pero cambiando cada frase. Aunque los verificadores de similitud indicaron un 50% de similitud, el texto final no compartía ninguna oración idéntica con la versión original. Al someter este texto reescrito a Pangram, la herramienta lo clasificó como 100% humano, confirmando que la intervención humana significativa puede alterar la detección de IA, incluso cuando el contenido original fue generado por un modelo de lenguaje.