jevlike: modelo de IA para elegir opciones de texto en una sola pasada

Fuentes: jevlike: AI model for single-pass text option selection

jevlike es un modelo de inteligencia artificial de código abierto diseñado para resolver tareas de selección de texto mediante una arquitectura de una sola pasada. A diferencia de los modelos de decodificación tradicionales que generan texto secuencialmente, este sistema recibe un contexto y una lista de N opciones de texto, devolviendo una probabilidad para cada una en un solo paso. El proyecto, iniciado por vinnylarouge, ofrece una alternativa independiente al modelo comercial Jev de TypeSafe, replicando su formato de entrada y salida sin revelar el diseño interno de este último.

La herramienta destaca por su eficiencia computacional: una sola pasada de evaluación es aproximadamente 100 veces más rápida que forzar a un decodificador pequeño a generar 400 tokens. El modelo utiliza un cabezal de atención compartido para puntuar opciones, permitiendo también evaluar botones de control en interfaces gráficas, como se demuestra en los ejemplos de Doom y ajedrez incluidos en el repositorio. Para el entrenamiento, el sistema soporta el aprendizaje desde cero con codificadores de bytes o el uso de codificadores preentrenados congelados de Hugging Face, como Qwen2.5-0.5B, lo que permite ajustar la memoria y el rendimiento según las necesidades.

El repositorio incluye scripts para generar datos sintéticos, entrenar modelos, evaluar la precisión (top-1 y top-3) y renderizar trazas de video. Los experimentos locales muestran que, con un encoder preentrenado, el modelo alcanza un 26% de precisión en datos de Wikispeedia, frente al 8% de un control aleatorio. Aunque el modelo es ligero y rápido, su rendimiento depende críticamente de la calidad de los datos y la elección del encoder, y requiere la lista completa de opciones antes de la predicción.