Optimización de etiquetado de commits con regresión logística

Fuentes: Optimizing commit labeling with logistic regression

El artículo describe una técnica para clasificar automáticamente commits de software como 'mantenimiento' o 'nuevo desarrollo' utilizando una combinación de modelos de lenguaje grandes (LLM) y regresión logística. El autor, al necesitar etiquetar 21.000 commits, identificó que llamar a un LLM para cada uno era lento (1,5 segundos por llamada) y costoso, aunque el coste por llamada era bajo. La solución propuesta implica un clasificador rápido y barato que actúa como filtro inicial.

El sistema utiliza una regresión logística entrenada en tiempo real mediante descenso de gradiente para clasificar rápidamente los casos obvios. Si el clasificador rápido tiene suficiente confianza, acepta la etiqueta; si no, consulta al LLM (como GPT-5.6 Luna) para obtener la etiqueta definitiva. Este proceso entrena simultáneamente al clasificador rápido con los datos nuevos, mejorando su precisión progresivamente. El código completo, escrito en Perl, ocupa menos de 40 líneas y no requiere librerías matemáticas avanzadas. Además, el texto aborda la calibración del modelo, detectando un sesgo en las probabilidades logarítmicas y proponiendo ajustes para mejorar la precisión final. Esta metodología permite reducir la latencia y el coste total de la clasificación manteniendo una alta precisión en la mayoría de los casos.