Jev, el primer modelo 'System One' de TypeSafe, promete generar decisiones tipadas con probabilidades calibradas, lo que permite a los usuarios confiar en la confianza de las respuestas. Sin embargo, un análisis técnico reciente argumenta que esta afirmación es problemática porque la calibración no es una propiedad intrínseca del modelo, sino que depende de la distribución de datos específica de cada organización. A diferencia de los modelos de lenguaje tradicionales que requieren datos de entrenamiento para adaptarse a tareas específicas, Jev funciona como un clasificador universal que no necesita datos de entrenamiento previos, lo que le permite ser útil en ausencia de datos, pero también impide que sus probabilidades sean fiables para distribuciones de datos externas.
El autor señala que, aunque TypeSafe afirma haber entrenado a Jev mediante aprendizaje por refuerzo para decisiones calibradas (RLCD), el modelo puede estar calibrado en sus datos de entrenamiento pero descalibrado en los datos de producción de otros usuarios. Además, se evidencia un sesgo significativo: en un experimento reciente, Jev predijo que una moneda justa cae con cabeza con una probabilidad del 92%, lo que indica una falla más grave que un simple desplazamiento de distribución. Dado que las probabilidades de Jev son consistentes para la misma entrada independientemente de la distribución de datos, se recomienda tratar sus salidas como puntuaciones de ranking y no como probabilidades exactas. Para obtener probabilidades calibradas, los usuarios deben recalibrar los scores de Jev con datos etiquetados propios, un proceso que es económico y viable mediante técnicas como la escalada de Platt.
