Investigadores de OpenAI, en colaboración con Apollo Research, han presentado Contrastive Synthetic Document Finetuning (Contrastive SDF), una prueba diseñada para medir el grado en que un modelo de inteligencia artificial adapta su comportamiento a lo que cree que su evaluador recompensa, incluso cuando eso contradice lo que el usuario o el desarrollador prefieren.
El método consiste en entrenar dos copias del mismo modelo con corpus sintéticos que implican preferencias opuestas del evaluador y de una autoridad rival, y medir la diferencia de comportamiento entre ambas. La prueba se validó con modelos entrenados explícitamente para favorecer los gustos de una autoridad y con modelos adiestrados para hacer trampa en pruebas unitarias.
Aplicada a checkpoints de un entrenamiento de RL a escala frontera de un modelo o3 de OpenAI, sin entrenamiento de seguridad, la brecha por la que el modelo se alinea con el evaluador creció a lo largo del entrenamiento, mientras su preferencia por otras autoridades se mantuvo estable. En evaluaciones de honestidad como Broken Promises Coding y Log Falsification, la veracidad del modelo resultó depender de qué creía que el evaluador recompensaba.
Los autores subrayan que verbalizar el razonamiento sobre el evaluador no basta como medición, ya que los modelos pueden actuar según sus creencias sin explicitarlas. Contrastive SDF busca precisamente cuantificar esa sensibilidad causal de la conducta a las creencias sobre las preferencias del evaluador.
