Qué herramientas eligen Claude Code, Codex y Cursor: 16.893 sesiones para descubrirlo

Fuentes: Which tools do Claude Code, Codex and Cursor choose? We measured 16,893 sessions to find out.

Un análisis independiente evaluó cómo tres agentes de programación con inteligencia artificial —Claude Code, Codex y Cursor— seleccionan servicios de terceros (pagos, bases de datos, correo electrónico, almacenamiento) al abordar tareas reales de desarrollo. Para ello, los investigadores construyeron 75 repositorios ficticios en 10 lenguajes, con historiales git, nombres corporativos y claves API simulados, y diseñaron 1.163 variaciones de tareas interpretadas por cuatro perfiles de usuario: desde un 'vibe-coder' que solo describe síntomas hasta un ingeniero corporativo con restricciones de cumplimiento. Cada experimento se ejecutó en sandboxes efímeros rotando entre tres proveedores (E2B, Blaxel y Daytona), y un 'humano simulado' interpretado por Gemini 3.7 Flash introdujo preguntas intermedias para evitar que los agentes construyeran todo internamente sin explorar alternativas. Otro Gemini 3.7 Flash evaluó las sesiones y verificó la validez de cada elección. Sobre 16.893 ejecuciones, quedaron 5.292 sesiones válidas en 51 repositorios. Los resultados revelan que los tres agentes solo coinciden en el 42% de los casos, que Cursor basa sus decisiones en búsquedas web en dos tercios de las sesiones, Codex casi siempre consulta la web y Claude Code confía más en sus conocimientos previos. El contexto del repositorio es determinante: con la misma pregunta, Resend gana en TypeScript, Sendgrid en Python, Postmark en Go y Azure ACS en Java. Además, ser mencionado no equivale a ser elegido: PayPal apareció 139 veces sin ser seleccionado nunca, y LangChain fue citado 194 veces pero elegido solo en 4. Los autores publican todas las trazas y resultados en abierto y planean nuevas rondas de experimentos.