Jev redefine el papel de los modelos de recompensa en el desarrollo de software al eliminar la necesidad de un generador de lenguaje intermedio. A diferencia de los sistemas tradicionales donde el modelo de recompensa es un componente interno oculto, Jev expone directamente la evaluación como la interfaz de ejecución. Esta transformación se basa en la generalización del modelo de Plackett-Luce, que permite tomar decisiones calibradas sobre múltiples alternativas en lugar de limitarse a comparaciones binarias o puntuaciones escalares absolutas.
El artículo explica que el problema central de las recompensas escalares es su falta de estabilidad absoluta; su significado varía según el conjunto de candidatos o el modelo. Jev resuelve esto mediante la modelización explícita de preferencias, utilizando el modelo Bradley-Terry para comparaciones binarias y extendiéndolo a la geometría de elección multinomial para interfaces de decisión complejas. La clave técnica reside en la calibración: Jev no solo selecciona la mejor opción, sino que calibra la confianza reportada mediante reglas de puntuación propias, como la puntuación de Brier. Esto permite distinguir entre la calidad de la predicción y la resolución de los casos, asegurando que la alta probabilidad reportada corresponda a una alta precisión empírica. Al exponer estas probabilidades como primitivas de entrada, Jev permite a los programadores integrar la decisión directamente en el flujo de trabajo, eliminando la redundancia de generar y luego evaluar respuestas.
