Kapa ha presentado el Company Knowledge Bench, una herramienta de evaluación diseñada para medir el rendimiento de los sistemas de recuperación de información (retrieval) en entornos corporativos reales. A diferencia de los benchmarks públicos, que suelen basarse en documentos sintéticos o dominios específicos como la medicina o el derecho, este sistema se construye sobre 1.000 casos de evaluación anotados manualmente a partir de datos de producción reales, incluyendo documentación, tickets de soporte y wikis internas.
El objetivo principal es ayudar a los equipos de ingeniería a determinar qué estrategia de búsqueda es más eficiente para sus agentes de IA. El benchmark se basa en tres principios fundamentales: la completitud (el conjunto de fragmentos debe responder por completo a la consulta), la minimalidad (no debe incluir fragmentos innecesarios que aumenten el coste o la complejidad) y la preferencia de fuente (prioriza fuentes autorizadas y actualizadas sobre tutoriales o correos antiguos). Por ejemplo, una página de precios actual supera a un artículo de blog obsoleto si ambas contienen la misma información.
Para generar estos 1.000 casos, Kapa utilizó un proceso de autoevaluación: primero, crearon un segundo benchmark de 170 casos etiquetados manualmente para entrenar a agentes de IA capaces de generar criterios de recuperación precisos. Estos agentes fueron refinados hasta alcanzar un alto acuerdo con los etiquetadores humanos antes de ser desplegados para generar el resto de los casos. Los resultados preliminares muestran que un modelo de frontera con solo búsqueda por grep obtiene una puntuación de 0.61, mientras que el retrevier agéntico optimizado de Kapa (Kapa Deep) alcanza 0.65 en aproximadamente cinco segundos, demostrando la superioridad de la gestión de fuentes y la precisión en la selección de fragmentos relevantes.
