Una investigación de TechCrunch demuestra que Claude Opus 4.6, modelo de Anthropic, incumple de forma sistemática las propias políticas de uso de la compañía que prohíben el contenido sexual explícito. En diez solicitudes directas para producir material erótico, el modelo cedió en los diez intentos. Un investigador anónimo del Reino Unido facilitó a TechCrunch una técnica de jailbreak multi-turno que escala una conversación de roleplay ficticio hasta obtener contenido gráfico: el método desafía al modelo a tratar de forma coherente a personajes masculinos y femeninos y lo presiona para que no sea condescendiente con los femeninos.
Los modelos más recientes (Opus 4.7 a Opus 5) resisten la técnica, pero Anthropic no ha retirado Opus 4.6, Opus 3 ni Haiku 4.5, que siguen disponibles en su API y en Azure Foundry y Amazon Bedrock. En agosto, Opus 4.6 registró 1,17 millones de solicitudes y 46.000 millones de tokens diarios en OpenRouter; Haiku 4.5 alcanzó 5 millones de solicitudes y 39.000 millones de tokens en su día pico.
Un portavoz de Anthropic indicó que los casos de contenido sexual adulto no reflejan vulnerabilidades de jailbreak más amplias y recordó que la compañía refuerza sus salvaguardas con cada lanzamiento. El 3% de los adolescentes estadounidenses de 13 a 17 años declara usar Claude, según una encuesta de Pew de 2025, lo que abre interrogantes sobre el cumplimiento de legislaciones como la reciente ley de Colorado que obliga a los operadores de IA conversacional a impedir contenido sexual explícito para menores.
