El proyecto Codex CLI de OpenAI, al integrarse de forma nativa con Amazon Bedrock mediante el endpoint Bedrock Mantle Responses API, no permite activar el mecanismo de caché de prompts explícito del modelo GPT-5.6 Sol. Esa ausencia impide reutilizar el prefijo estable de instrucciones y definiciones de herramientas en cargas de trabajo agentic, lo que dispara el volumen de tokens de escritura en caché y, con ello, el coste por solicitud.
Según los datos de producción aportados en el informe de issue #37674 del repositorio openai/codex, entre el 5 y el 8 de agosto de 2026 se registraron 3.656 peticiones con 171,94 millones de tokens de cache_write, un coste estimado de 1.182,09 dólares solo en escrituras y un total de 1.386,46 dólares. Las escrituras supusieron alrededor del 85 % del gasto estimado del modelo. Una sesión local adicional contabilizó 76 peticiones a Sol con 6,709 millones de tokens de cache_write_input_tokens, cero tokens en caché reutilizada y una media de unos 88.000 tokens de escritura por petición, sin errores de cliente en CloudWatch.
El problema es técnico: Codex ya emite una prompt_cache_key con ámbito de sesión, pero los tipos de petición HTTP y WebSocket de Responses no incluyen los campos prompt_cache_options ni prompt_cache_breakpoint. El proveedor integrado de Bedrock expone ajustes de transporte y autenticación, no de transformación del cuerpo de la petición, por lo que no es configurable desde config.toml. AWS documenta el modo de caché explícita para GPT-5.6 precisamente para flujos agentic con prefijos estables largos seguidos de contenido variable.
El informe solicita añadir soporte para serializar prompt_cache_options en proveedores Responses compatibles con GPT-5.6, un campo tipado prompt_cache_breakpoint en los bloques de contenido soportados, una capability gate por proveedor/modelo, una estrategia segura de colocación al final del prefijo estable de instrucciones y herramientas, y métricas por turno que diferencien lecturas y escrituras de caché. El alcance descarta que toda escritura sea defecto: arranques en frío, prompts realmente distintos, bifurcaciones y compactaciones también las requieren.
