Cómo funcionan las marcas de agua en texto generado por IA

Fuentes: Text Watermarking for Non-Academics, declaude.org

Cómo funcionan las marcas de agua en texto generado por IA

El reciente anuncio de Anthropic sobre el sistema de marcas de agua en el texto generado por Claude ha sacado del terreno teórico una tecnología que hasta ahora solo existía en publicaciones académicas. A diferencia de las marcas de agua en imágenes, que alteran píxeles de forma imperceptible, o del metadatos en archivos digitales, el texto plano aparentemente no ofrece un lugar donde esconder una señal de procedencia: copiar y pegar elimina cualquier información adicional del documento original.

Sin embargo, el texto contiene mucha más información de la que transmite su significado literal. Cada escritor —y también cada modelo de lenguaje— toma constantemente pequeñas decisiones entre alternativas equivalentes: usar "pero" o "sin embargo", escribir "no" o "no lo hace", preferir frases cortas o largas, decantarse por un punto y coma o un guion largo. Estas elecciones, acumuladas a lo largo de un texto, generan un patrón estadístico medible. La redundancia del lenguaje natural es lo que permite que esta señal quede impresa en las propias palabras elegidas.

El mecanismo técnico

Según explica el blog de Gábor Koós, un modelo de lenguaje genera texto eligiendo tokens —que pueden ser palabras, fragmentos de palabra o signos de puntuación— a partir de distribuciones de probabilidad para cada posición. Un sistema de marcas de agua interviene en ese proceso de selección, inclinando la elección hacia ciertas alternativas aceptables. Ninguna decisión individual resulta reveladora: encontrar "sin embargo" en un párrafo no prueba nada, pues cualquier escritor humano podría haberlo usado.

El valor probatorio aparece cuando cientos o miles de estas pequeñas elecciones se inclinan de forma coordinada en una dirección que el azar no explicaría fácilmente. Por eso, las marcas de agua estadísticas pertenecen a una categoría distinta de una etiqueta visible o un mensaje oculto fijo: dependen de evidencia acumulada y solo son detectables analizando el texto como un todo.

La tradición previa: la estilometría

Esta idea no es nueva. El campo de la estilometría estudia los patrones lingüísticos de los escritores desde antes de la inteligencia artificial generativa. Rasgos como la frecuencia de palabras funcionales, las preferencias de puntuación, la longitud media de las frases o las construcciones gramaticales recurrentes permiten comparar textos y estimar la autoría con cierto grado de probabilidad.

La estilometría funciona por comparación, no por búsqueda de una firma única incrustada en cada documento. A partir de textos de autoría conocida, se construye un perfil de hábitos; luego se compara con un texto anónimo. Un parecido estrecho eleva la probabilidad de autoría común; uno débil la reduce. Cuanto más largo es el texto analizado, más estable resulta la evidencia, porque la variación accidental se promedia y las tendencias persistentes emergen con mayor claridad.

Ahora bien, los análisis estilométricos producen conclusiones estadísticas, no certezas absolutas. El tema del texto afecta al vocabulario, el género cambia el registro, la edición puede borrar los hábitos usuales del autor, y las personas modifican su estilo con el tiempo. Un conjunto de correos informales ofrece una línea base pobre para atribuir un manual técnico, aunque ambos textos pertenezcan al mismo candidato.

Implicaciones y perspectivas

El anuncio de Anthropic da al tema relevancia práctica inmediata, pero la técnica es más amplia que Claude o cualquier proveedor individual. Distintos desarrolladores pueden usar reglas de selección de tokens y métodos de detección diferentes, y las descripciones públicas no constituyen una especificación completa de implementación. Los principios descritos en el análisis de Koós describen la tecnología en general, sin atribuir un diseño concreto a Anthropic.

Una diferencia clave entre las marcas de agua industriales y la estilometría tradicional es la intención. Los sistemas de watermarking introducen una señal deliberada y detectable; los patrones estilométricos humanos emergen de manera espontánea como subproducto de los hábitos de escritura. Los modelos de lenguaje generan texto mediante un proceso distinto al humano, pero también toman decisiones repetidas con tendencias medibles, lo que permite aplicar técnicas estadísticas comparables.

Qué esperar

La detección de marcas de agua en texto de IA se enfrenta a límites prácticos evidentes. Un usuario que edita manualmente el texto generado puede alterar suficientes elecciones para diluir la señal estadística. Textos muy cortos ofrecen poca evidencia. Y la frontera entre un patrón natural del lenguaje y una marca intencional puede volverse borrosa cuando los modelos se entrenan con literatura humana que ya contiene sus propios sesgos estilísticos.

Por ahora, las marcas de agua estadísticas representan una herramienta probabilística, no una prueba definitiva. Permiten afirmar que un texto es consistente con haber sido generado por un sistema marcado —o que esa coincidencia sería estadísticamente improbable—, pero no ofrecen la certeza de leer un nombre de autor en la cabecera de un documento. Su valor dependerá de cómo se integren en flujos de trabajo reales: detección de plagio académico, verificación de procedencia en medios de comunicación, o filtros en plataformas que requieran identificar contenido sintético. La tecnología existe; su adopción masiva y su aceptación como evidencia son cuestiones que apenas empiezan a plantearse.