El watermarking de Claude altera el comportamiento de los agentes de IA

Fuentes: Claude Watermarking Alters AI Agent Behavior and Tool Selection

Anthropic ha anunciado que sus futuros modelos de Claude incorporarán un watermark invisible basado en la tecnología SynthID-Text de Google DeepMind. Esta medida, obligatoria por el Artículo 50(2) de la Ley de IA de la Unión Europea, busca garantizar la trazabilidad de los textos sintéticos. Sin embargo, una investigación reciente revela que esta técnica no solo marca el contenido, sino que introduce un 'desviación de muestreo' (sampling drift) que afecta significativamente al comportamiento de los agentes de IA. Al modificar la selección de tokens durante la generación, el watermark puede cambiar la decisión de un modelo de rechazar una solicitud dañina o alterar la herramienta y los argumentos que un agente ejecuta. Los estudios muestran que, aunque la precisión agregada puede mantenerse estable debido a compensaciones entre errores, la tasa de discrepancia entre ejecuciones con y sin watermark es sustancial. Por ejemplo, en el modelo phi-4, el 16,8% de las decisiones de llamada de herramientas difieren entre ambas condiciones, a pesar de una pérdida de precisión neta menor. Este fenómeno, denominado 'provenance tax', plantea desafíos críticos para la seguridad y la fiabilidad de los sistemas de IA que operan como componentes de agentes autónomos, donde un error en la selección de herramientas puede tener consecuencias operativas graves.