Anthropic ha publicado una guía detallada para reducir el coste por tarea al programar con Claude Code, su asistente de desarrollo con IA. La pieza parte de una idea central: en las herramientas agénticas como Claude Code, cada tarea completada tiene un precio distinto en función de cómo se gestione la sesión, a diferencia de los editores tradicionales con tarifa plana.
El artículo desgrana los tres factores que determinan el coste de un token: el modelo utilizado, si se trata de token de entrada o de salida, y si se sirve desde la caché de prompts. Los tokens de salida se facturan aproximadamente cinco veces más que los de entrada porque la fase de decodificación mantiene ocupada la GPU durante más tiempo. La lectura desde caché cuesta solo 0,1 veces el precio de entrada, mientras que la escritura en caché puede llegar a duplicar el precio de entrada; aun así, el equilibrio suele ser rentable porque las lecturas se repiten en cada turno.
A partir de ahí, la guía ofrece recomendaciones operativas: ejecutar /model y /effort al inicio de una sesión limpia para fijar valores por defecto, recurrir a MAX_THINKING_TOKENS=0 en tareas mecánicas, usar /clear entre tareas, /context al comenzar para revisar qué se carga, y /compact antes de un descanso porque la caché expira a la hora. También advierte de que cambiar de modelo o nivel de esfuerzo a mitad de conversación invalida la caché y dispara el coste, mientras que /rewind solo corta turnos del final sin romper el prefijo.
El texto cierra con la fórmula del coste total de una sesión: cuántos tokens entran en el contexto, cuántos turnos permanecen activos y cuántos contextos se ejecutan en paralelo.
