MicroLLM lab es una plataforma web diseñada para evaluar el rendimiento de modelos de lenguaje de gran escala (LLM) de tamaño reducido, como los de 135 millones de parámetros. A diferencia de las métricas tradicionales centradas en la calidad literaria o creativa, esta herramienta se basa exclusivamente en pruebas objetivas verificables, utilizando expresiones regulares (regex) y la coincidencia exacta de tokens. El objetivo es medir la precisión técnica y la velocidad de inferencia de manera rigurosa, permitiendo a los desarrolladores comparar modelos de forma cuantitativa.
La plataforma opera mediante una suite de pruebas que se ejecuta directamente en el navegador del usuario. Los usuarios pueden seleccionar modelos específicos y ejecutar las pruebas para obtener métricas en tiempo real, incluyendo la velocidad sostenida de decodificación (tokens por segundo) y la tasa de éxito en las pruebas objetivas. Un aspecto distintivo de MicroLLM lab es su transparencia: los datos de rendimiento se almacenan localmente en el dispositivo del usuario, garantizando la privacidad y evitando el envío de datos a servidores externos. Además, la herramienta ofrece la generación de certificados de rendimiento verificables, que incluyen información sobre el hardware del dispositivo y las capacidades de procesamiento, permitiendo a los usuarios compartir sus resultados de forma verificable.
Para facilitar la personalización, la plataforma incluye un editor de JavaScript que permite a los usuarios definir sus propios benchmarks. Este editor utiliza la función eval() en el mismo origen para ejecutar el código, asegurando que las pruebas se ejecuten sobre el texto decodificado por el modelo. El sistema permite definir funciones con la forma de un modelo de lenguaje, especificando el número máximo de tokens nuevos y la estructura de las pruebas. Por ejemplo, se puede crear una prueba para verificar si un modelo identifica correctamente las capitales de países, utilizando expresiones regulares para validar la respuesta. Esta flexibilidad permite a los desarrolladores adaptar las pruebas a sus necesidades específicas, desde verificaciones de conocimiento factual hasta pruebas de formato de salida. La herramienta es ideal para ingenieros de IA que buscan métricas objetivas para la selección y optimización de modelos de lenguaje, priorizando la precisión técnica sobre la creatividad.
