CLM (Contrastive Language Model) es un sistema de modelos de lenguaje diseñado para facilitar la toma de decisiones rápidas y generalizables en entornos de uso de computadoras, juegos y llamadas a herramientas. Desarrollado por investigadores de Stanford University y NVIDIA, este enfoque utiliza un objetivo de contraste (InfoNCE) para entrenar un codificador de estados y otro de acciones a partir de un conjunto de datos a gran escala. Durante el entrenamiento, cada estado se atrae hacia la acción de verdad conocida y se aleja de las demás, permitiendo que ambos codificadores funcionen como clasificadores de acciones sin necesidad de entrenamiento adicional (zero-shot).
En la fase de despliegue, el sistema evalúa cada acción candidata basándose en la alineación de sus representaciones vectoriales con la del estado actual, seleccionando la opción con la puntuación más alta. Este mecanismo permite a CLM-8B competir en rendimiento con Jev, una herramienta de referencia, pero a una velocidad hasta 9 veces superior. Las mejoras de velocidad son más significativas en tareas donde el número de acciones candidatas es alto, como en WikiRacing, o donde las acciones pueden reutilizarse frecuentemente entre estados, como en el juego T-Rex. La arquitectura de CLM destaca por su eficiencia computacional, ofreciendo una alternativa viable para sistemas que requieren respuestas inmediatas sin sacrificar la precisión en la clasificación de acciones complejas.
