NEEDLE: un benchmark en vivo para medir motores de búsqueda pensados para agentes

Fuentes: NEEDLE: a live benchmark for agentic web search quality

Keenable ha presentado NEEDLE, un benchmark en vivo y de código abierto diseñado para evaluar la calidad de los motores de búsqueda en escenarios de uso por agentes de inteligencia artificial. El proyecto surge de una constatación: los buscadores actuales —incluido el propio Keenable— están lejos de lo que el tráfico agéntico permitiría, pero esa brecha es difícil de medir porque los benchmarks estáticos como BrowseComp sufren sobreajuste y fuga de datos, hasta el punto de que algunos modelos descargan las respuestas directamente desde HuggingFace durante la evaluación.

NEEDLE aborda estos problemas con consultas renovables a diario o cada hora y sin respuestas memorizables. Sus tareas se organizan en cinco verticales: noticias (generadas a partir de fuentes RSS y Google Trends), finanzas (consultas sobre empresas y registros de la SEC con respuestas verificables en Wikidata, GLEIF y SEC XBRL), literatura académica (buscar un paper a partir de títulos degradados o descripciones incompletas), entidades raras (consultas de cola larga tomadas de logs reales de agentes como DeepResearchGym, LRAT y OpenResearcher) y legal (opiniones judiciales y secciones del Código de Regulaciones Federales de EE. UU.).

La evaluación compara a Keenable con Google, Bing, Brave, Tavily, Parallel y Exa, e incluye además un techo sintético construido con los mejores resultados combinados de todos los motores. Los resultados revelan diferencias notables entre categorías: las consultas sobre datos empresariales están prácticamente resueltas, las búsquedas por palabras clave separan a los motores según indexen el cuerpo completo de los documentos o solo metadatos, y las consultas en lenguaje natural o de cola larga, las más cercanas al tráfico real de los agentes, son las que muestran la mayor distancia entre la calidad obtenida y la potencialmente alcanzable.