Wattage: perfilador de gasto de tokens y puerta de regresión de costes para agentes de IA

Fuentes: Wattage: a token-spend profiler and cost-regression gate for AI agents

Wattage es una herramienta de línea de comandos que analiza trazas de agentes de inteligencia artificial para localizar dónde se queman tokens de forma innecesaria, calcula el coste en dólares de cada patrón de desperdicio y propone una corrección concreta. Funciona sin archivo de configuración, sin clave de API y sin conexión: recibe una exportación OTLP JSON de OpenTelemetry y aplica ocho detectores sobre un modelo de datos normalizado (sesiones → tareas → bucles → iteraciones → llamadas), construido a partir de las convenciones semánticas GenAI de OpenTelemetry.

Los detectores identifican problemas como prefijos estables reenviados en lugar de cachearse (prefix_churn), caché infrautilizado (cache_gap), verbosidad excesiva, llamadas redundantes a herramientas, bucles que no convergen (nonconvergence), búsquedas repetidas sin resultados útiles, uso de modelos más caros de lo necesario y gasto desmedido en tokens de razonamiento. Cada hallazgo se valora en dólares, incorpora una corrección accionable y se etiqueta con un nivel de riesgo de calidad (none, low, review); las correcciones que podrían alterar la calidad solo cuentan cuando se aportan pruebas reales.

Además del informe, Wattage genera una nota Token Efficiency de 0 a 100 para insignias de README y una puerta de integración continua (wattage ci) que falla la compilación cuando una fusión empeora la eficiencia más allá de un umbral configurable, publica una tabla delta por detector como comentario en la pull request y emite SARIF y JUnit XML. Su motor de convergencia supera con claridad a un detector de duplicados por coincidencia exacta SHA-256, con F1 de 1,00 frente a 0,25, y en una traza capturada en producción muestra una reducción del 44,7 % del coste al activar la caché de prompts.