En Quesma Blog, un investigador comparte cómo construyó un sistema de investigación profunda con agentes de IA capaz de ejecutarse durante horas sin aumentar el gasto en suscripciones. Su primer intento con Claude Max 5x agotó todo el límite de tokens en 30 minutos: 111 agentes lanzados, solo 25 afirmaciones verificadas y sin síntesis final. El problema combinaba coste y confianza: los resultados parecían sólidos pero incluían licencias erróneas, cifras sin fuente o números inexistentes en las páginas citadas.
La solución articula tres ejes. Primero, repartir el trabajo entre varios modelos según su rol: Claude Sonnet 5 para búsqueda, Claude Opus 4.8 para verificación, Claude Haiku 4.5 para tareas menores, Codex (GPT-5.5) para ejecutar herramientas y Gemini 3.1 Pro como segunda opinión, todo orquestado desde Claude. Segundo, desplegar Codex y Gemini como subagentes headless desde Claude mediante un script Bash, de forma que el consumo se imputa a las suscripciones de cada proveedor y un sistema de fallback activa modelos Claude cuando se alcanza un límite. Tercero, fijar el modelo por rol para evitar que los subagentes hereden el modelo caro del padre.
Para reducir alucinaciones, el autor impone reglas de verificación: quien encuentra una afirmación nunca la verifica, ningún dato entra sin URL y cita textual de la fuente primaria, y ningún número puede afirmarse si no aparece en la página. La herramienta /deep-research se relega al final del pipeline, aplicada sobre hallazgos ya validados, lo que reduce su consumo de tokens. El resultado, según el autor, es una wiki en Obsidian con cientos de notas verificadas sobre precios, herramientas, benchmarks y prácticas, tras una semana de trabajo.
