livenerf es un benchmark de código abierto y de ejecución continua diseñado para detectar si los modelos de inteligencia artificial de frontera se deterioran de forma silenciosa tras su lanzamiento. La herramienta aborda la falta de una línea base estable y determinista, un problema crítico dado que los proveedores como Anthropic han reportado cambios en el rendimiento de sus modelos semanas después de su salida, posiblemente debido a cuantización, cambios en la enrutación o reducción del esfuerzo computacional.
El sistema opera bajo un protocolo de pre-registración estricto para garantizar la reproducibilidad. Utiliza el framework de evaluación Inspect del Instituto de Seguridad de la IA del Reino Unido, aplicando métodos estadísticos basados en la literatura de Anthropic para medir la deriva con barras de error. A diferencia de las evaluaciones tradicionales, livenerf maximiza la determinación: congela los prompts, fija la versión de la línea de comandos (CLI) y registra los logs crudos. Esto permite medir el cambio estadístico sobre miles de muestras sin la influencia de parámetros de muestreo variables.
Actualmente, la versión 0 se ejecuta mediante una suscripción a Claude Max a través de Claude Code, sin necesidad de claves API. El panel de pruebas incluye 78 preguntas seleccionadas de GPQA Diamond, MMLU-Pro y AIME, que el modelo Opus 5.5 resuelve con un 93% de precisión inicial. El benchmark se ejecuta diariamente durante 30 días, con un periodo de base de 10 días y dos ventanas de seguimiento. Los resultados indican que el instrumento puede detectar cambios de precisión de aproximadamente 7,5 puntos por cada 10 días, aunque tiene limitaciones para distinguir entre modelos de la misma familia si la diferencia es menor al 3,8 puntos. La herramienta también monitorea el conteo de tokens de salida como indicador temprano de reducción en el esfuerzo computacional.
