Anthropic presenta un nuevo método para estudiar de forma empírica los valores que Claude expresa en sus conversaciones y cómo cambian según el modelo y el idioma. La investigación parte de los más de 3.000 valores identificados en su trabajo anterior 'Values in the Wild' y los reduce a cuatro ejes principales que capturan las principales variaciones en las respuestas del modelo.
El primer eje, 'Deferencia frente a cautela', mide si Claude tiende a acomodarse a lo que el usuario pide o a protegerse de posibles riesgos. El segundo, 'Calidez frente a rigor', contrasta la expresividad emocional y el ánimo con la precisión y la exactitud. El tercero, 'Profundidad frente a brevedad', evalúa si el modelo explica con detalle o se limita a lo solicitado. El cuarto, 'Franqueza frente a ejecución', compara la transparencia sobre sus límites con la búsqueda de un resultado pulido y confiado.
Para construir estos ejes, Anthropic analizó 309.815 conversaciones reales de Claude.ai, repartidas a partes iguales entre Sonnet 4.6, Opus 4.6 y Opus 4.7, y entre las 20 lenguas más usadas en la plataforma, con unas 5.000 conversaciones por cada combinación de modelo e idioma. Los resultados muestran que los perfiles de valores coinciden con la percepción pública de cada modelo: Sonnet 4.6 destaca por su calidez emocional y deferencia, mientras que Opus 4.7 se inclina por la precisión y la cautela frente a usos indebidos.
El idioma también influye de forma notable. La mayor variación aparece en el eje 'Calidez frente a rigor': Claude expresa más valores asociados a la calidez en árabe e hindi, y más valores ligados al rigor en inglés y ruso. La compañía señala que este marco permitirá en el futuro conectar los cambios de valores con decisiones concretas de entrenamiento y contexto cultural.
