Desarrollo dirigido por evaluación: lecciones de Airbnb sobre IA generativa a escala

Fuentes: Eval-driven development: Lessons from evaluating GenAI at scale

Airbnb ha consolidado su experiencia evaluando productos de IA generativa en una disciplina de ingeniería que trata la evaluación como un pilar de primer orden, no como un trámite posterior. El artículo describe la práctica del "eval-driven development" (EDD), un equivalente para modelos de lenguaje del desarrollo dirigido por pruebas, basado en cinco principios: definir objetivos y umbrales de calidad desde el inicio; construir métricas a partir de errores reales observados en los datos; mantener un conjunto reducido y preciso de 3 a 5 evaluadores LLM-como-juez, cada uno centrado en una dimensión concreta; designar una persona con autoridad final para decidir qué es un buen resultado; y mantener una colaboración continua con el equipo de producto para validar mejoras y degradaciones.

Los autores proponen un sistema de evaluación en tres capas. La primera aplica comprobaciones programáticas y heurísticas rápidas y de bajo coste, apoyadas en salidas estructuradas en JSON, para detectar fallos evidentes. La segunda recurre a un modelo de lenguaje más potente como juez virtual, capaz de evaluar matices como tono, coherencia o fidelidad mediante rúbricas explícitas y sin ambigüedad. La tercera capa corresponde a evaluación humana, reservada para dominios de alto riesgo y para calibrar el resto del sistema. Un punto crítico es la calibración de los jueces virtuales frente a un conjunto de datos de referencia de entre 50 y 100 ejemplos, con acuerdos medidos mediante coeficiente kappa de Cohen o alfa de Krippendorff en el rango del 80-90 %.

El texto insiste en que mirar manualmente los datos —revisar unas 100 ejecuciones, categorizar errores y traducirlos en métricas— es el hábito más rentable para mejorar la calidad de un producto de IA generativa, por encima de cualquier framework o metodología.