Nueva metodología evalúa la independencia de los jueces de LLM

Fuentes: New method assesses independence of LLM judges in evaluation

Un equipo de investigadores de Amazon ha presentado en la Conferencia Internacional de Aprendizaje por Máquinas (ICML) un método para mejorar la evaluación de sistemas de generación asistida por recuperación (RAG) mediante el análisis de la dependencia entre los modelos de lenguaje que actúan como jueces. El estudio, titulado 'Dependence-aware label aggregation for LLM-as-a-judge via Ising models', aborda la limitación de los métodos de votación mayoritaria tradicionales, que asumen erróneamente que los errores de los jueces son independientes. En la práctica, varios modelos pueden compartir sesgos o interpretaciones similares, lo que hace que la mayoría de votos sea una señal débil de evidencia real.

La propuesta utiliza modelos de Ising para modelar las relaciones de dependencia entre pares de jueces, permitiendo ajustar las probabilidades de etiqueta agregadas según la correlación observada. El enfoque es no supervisado y se entrena utilizando únicamente los registros de evaluación existentes, sin necesidad de etiquetas de referencia humanas durante el proceso de aprendizaje. En pruebas realizadas en tres tareas distintas (clasificación de relevancia, toxicidad y evaluación de resúmenes) con un panel de 10 modelos, el método superó a las líneas base de votación ponderada y uniforme en un rango del 9% al 14% de precisión. Los resultados más altos alcanzaron una precisión del 0.912 en la clasificación de relevancia, frente al 0.820 de la votación ponderada. Esta técnica es particularmente útil para equipos que ya operan a gran escala, ya que transforma los patrones de acuerdo y desacuerdo en señales cuantificables para detectar redundancias o sesgos compartidos en los paneles de evaluación.