Un desarrollador ha creado un wrapper para modelos de lenguaje de gran escala (LLM) inspirado en la herramienta Jev, que permite evaluar la probabilidad de tokens de los modelos mediante la lectura de logprobs. Esta técnica, aunque conocida en la industria, fue nueva para el autor, quien la implementó para analizar el rendimiento de modelos de visión. El método consiste en forzar la generación de un único token por pregunta utilizando parámetros específicos de la API, lo que permite obtener rápidamente la respuesta más probable y sus alternativas. El autor ha extendido esta funcionalidad para incluir modelos de visión, añadiendo un campo de adjuntos para imágenes en el formato de solicitud de Jev. En sus pruebas con un modelo Gemma 4 12B en una RTX 3090, logró procesar aproximadamente un frame por segundo, mientras que con OpenAI gpt-6-luna la velocidad fue de 0.2 FPS, limitación atribuida a las conexiones separadas requeridas por la API de OpenAI. El código proporcionado es un ejemplo independiente en Python que utiliza OpenCV para acceder a la cámara web y envía los frames codificados en base64 a la API. Este enfoque destaca por su flexibilidad, ya que las condiciones pueden modificarse describiéndolas en texto plano, sin necesidad de cambiar la estructura del prompt. Aunque los modelos de visión especializados son más eficientes, esta herramienta ofrece una alternativa versátil para el análisis de datos en tiempo real mediante LLMs.
