DoGBench es un benchmark diseñado para medir la capacidad de los agentes de inteligencia artificial para generar y mantener documentación técnica de usuario de calidad experta. La herramienta evalúa a los agentes mediante 292 tareas extraídas de proyectos de código abierto reales, como Helm, PostHog y Mautic, donde cada parche se califica con rúbricas validadas por mantenedores de proyectos. El objetivo no es comparar el rendimiento relativo de un agente con un humano, sino medir el progreso hacia los estándares de calidad aceptados por expertos.
El estudio revela que, aunque los agentes pueden producir textos pulidos, frecuentemente omiten información crítica necesaria para completar una tarea, como requisitos previos o pasos de verificación. En una auditoría de 1.267 contribuciones, el 45,5% de los documentos presentaban vacíos de ejecución y el 36,6% contenían inexactitudes técnicas. Los resultados muestran que el modelo Qwen3.8 Max con OpenCode obtuvo la puntuación más alta (47,3/100) en el conjunto de datos de prueba, mientras que la tasa de entrega de parches libres de fallos críticos (P0-clean) fue del 39,0% en la mejor trayectoria evaluada. La investigación concluye que el contexto humano, que incluye el perfil del lector y el flujo de trabajo, sigue siendo esencial para determinar si una actualización es necesaria y qué debe cubrir, una función que los agentes actuales no dominan plenamente.
