La API de decisiones de OpenAI falla en la calibración de confianza

Fuentes: OpenAI's Decisions API Model Fails to Calibrate Confidence Accurately

Un análisis independiente revela que el modelo GPT-6 Luna, base de la nueva API de decisiones de OpenAI, presenta una calibración deficiente en la confianza. Aunque OpenAI anunció la API en DevDay con un tiempo de respuesta de 150 milisegundos, los investigadores de The Decoder y Axios evaluaron a Luna con 3.600 problemas de razonamiento del dataset ProofWriter. En tareas de lógica de cinco pasos, Luna acertó solo el 46% de las veces, frente al 81% de su competidor Jev, mostrando una caída drástica en precisión con la profundidad del razonamiento.

El estudio destaca que, aunque Luna es precisa en respuestas directas, falla en casos donde la respuesta está explícitamente en el texto, atribuyéndole una confianza del 100% erróneamente. Además, la API no permite acceder a las probabilidades logarítmicas cuando se activa el razonamiento, limitando la capacidad de los desarrolladores para establecer umbrales de confianza fiables. A diferencia de los modelos anteriores que exponían estas métricas, Luna oculta esta información, lo que dificulta la implementación de sistemas de seguridad robustos que dependen de la verificación de la certeza del modelo antes de actuar.