Un análisis automatizado detecta fallos de usabilidad en un tercio de los servidores MCP populares

Fuentes: I lint-scanned 36 popular MCP servers. A third of them are failing your agent.

mcpgrade es una herramienta de código abierto, estilo Lighthouse, que evalúa servidores del Model Context Protocol (MCP) desde el punto de vista de un modelo de IA, no solo del de cumplimiento del estándar. Su autor, ingeniero de integraciones de IA en producción, la creó tras observar que muchos servidores cumplen la especificación pero resultan inutilizables para los agentes: el modelo elige la herramienta equivocada, alucina argumentos o ignora la herramienta directamente.

El autor escaneó 36 servidores populares y clasificó sus resultados. Quince obtuvieron nota A; once suspendieron con D o F, incluidos servidores oficiales de MongoDB (66), Notion (62), Airtable (69 con 66 errores), un servidor archivado de GitHub (67) y firecrawl, en último lugar con 57 puntos y 134 errores. El patrón dominante es la falta de descripciones en parámetros: 132 de los 134 errores de firecrawl son parámetros sin documentar; todoist suma 110 y MongoDB y Airtable, 66 cada uno. El problema suele originarse en generadores automáticos a partir de zod u OpenAPI que omiten el método .describe().

La evaluación incluye, además del lint estático, una prueba con un modelo real (--eval) que mide tanto la selección correcta de herramienta como la capacidad del agente de negarse a actuar cuando la tarea queda fuera de alcance. En servidores bien documentados la tasa de acierto fue del 100%; en firecrawl cayó al 84%. Frente a tareas deliberadamente fuera de ámbito, el modelo rechazó el 100% de las peticiones en catálogos pequeños, pero solo el 50% en los 26 herramientas difusas de firecrawl. mcpgrade se distribuye como paquete npm (npx mcpgrade) y admite integrarse en pipelines de CI.