Un investigador ha desarrollado RL Agent, un modelo de decisión no autoregresivo con 421 millones de parámetros que opera en 33 a 38 milisegundos, superando en cuatro veces la latencia del sistema Jev de TypeSafe AI. El proyecto, que comenzó en marzo de 2025, busca resolver la ineficiencia de los modelos de lenguaje generativos (LLM) para tareas de decisión simple, como la clasificación de tickets de soporte o la detección de phishing, que suelen requerir tiempos de respuesta de 500 a 2000 milisegundos y generan probabilidades no calibradas.
A diferencia de los LLMs, RL Agent utiliza un codificador bidireccional ModernBERT-large como base, combinado con una red de decisión de 25,2 millones de parámetros. El sistema evalúa preguntas tipadas en una sola pasada paralela, devolviendo etiquetas, puntuaciones y probabilidades calibradas sin generar texto. Esta arquitectura elimina la necesidad de parsers de JSON y reduce drásticamente los costes de inferencia. El autor, quien publicó los pesos abiertos en Hugging Face, critica la falta de transparencia técnica por parte de TypeSafe AI, que lanzó Jev sin publicar papers ni datos de entrenamiento abiertos, aunque el sistema de Jev ofrece una latencia de 150 ms y un coste de 0,042 dólares por millón de tokens. RL Agent se posiciona como una alternativa más rápida y transparente para aplicaciones de decisión en tiempo real.
