Un ingeniero de Spotify describe en el blog de ingeniería de la compañía cómo logró recortar cerca del 90% del consumo de tokens de Claude Code, el agente de programación de Anthropic, utilizando los modos de AiKA integrados en Portal, la plataforma interna de Spotify basada en Backstage. La idea central es desviar las tareas mecánicas —lectura masiva de archivos y generación de código repetitivo— hacia un modelo más económico como Gemini 2.5 Flash, y reservar Claude solo para el razonamiento complejo.
Para ello construyó dos modos declarativos en Portal: bulk-reader, que resume múltiples archivos y responde preguntas concretas con viñetas estructuradas, y code-writer, que genera código siguiendo patrones existentes a partir de una especificación y un archivo de referencia. Ambos se ejecutan en un runtime efímero sin claves de API ni servidores que mantener.
La delegación se articula mediante un plugin para Claude Code llamado shunt, organizado en tres capas: hooks PreToolUse que bloquean lecturas de archivos grandes por encima de un umbral configurable (350 líneas por defecto), scripts bash que envuelven las llamadas a la CLI de Portal, y archivos de skills que indican a Claude cuándo y cómo invocar cada script. Las pruebas, realizadas sobre un monorepositorio Java, muestran ahorros medios del 90% en tokens para lecturas masivas. El artículo también señala limitaciones: no se puede delegar la edición de código porque los resúmenes no incluyen números de línea fiables, ni el razonamiento profundo —un modelo económico pasó por alto un bug de concurrencia que Claude detectó en segundos—, por lo que la depuración y las decisiones arquitectónicas siguen requiriendo el modelo principal.
