Netflix opera dos autoscalers de Flink y converge hacia el de código abierto

Netflix ejecuta desde 2017 procesamiento de flujos con Apache Flink y, en 2026, supera las 30.000 tareas distribuidas en varias regiones de AWS. La mayor parte las genera de forma automática su plataforma gestionada Data Mesh, aunque crece el número de trabajos a medida que equipos internos construy

Cómo contener el gasto en IA para programación a escala empresarial

Las herramientas de programación con IA aportan un valor enorme, pero su coste crece de forma exponencial y amenaza con superar al ahorro que generan. Este artículo recoge técnicas probadas por grandes adoptantes tempranos como Databricks, Stripe, Coinbase, Uber y Ramp para mantener la inversión baj

Por qué Manifest retiró su enrutador de LLM tras meses de pruebas

La empresa Manifest ha detallado los motivos que la llevaron a desactivar en junio y cerrar definitivamente el 1 de septiembre su enrutador de modelos de lenguaje, una función que había lanzado en marzo dentro de su pasarela LLM. El sistema clasificaba cada petición en cuatro niveles de complejidad

Refactorizar código generado por agentes reduce un 83% el coste en tokens

Refactorizar una base de código escrita íntegramente por agentes de inteligencia artificial reduce de forma significativa el coste computacional de los cambios posteriores. Es la conclusión de un experimento publicado por Thoughtworks el 30 de julio de 2026 en el que el autor, tras construir una apl

claude-thermos: un proxy local para mantener caliente la caché de Claude Code

claude-thermos es una herramienta de línea de comandos que envuelve a Claude Code en un proxy local inverso para evitar el coste oculto de la pérdida de caché de prompts. Cuando un agente principal queda bloqueado a la espera de un subagente durante más de cinco minutos, la caché de su historial de

El keepalive del caché en flujos agentic cuesta 8 veces más de lo necesario

Artículo técnico que desmonta la convención habitual de hacer ping al caché de prompts cada 30 segundos y demuestra, con mediciones reales, que ese intervalo es entre 6 y 8 veces más caro de lo necesario. El autor probó el comportamiento del keepalive en cuatro proveedores principales —Anthropic, Op

Ramp lanza Router, un enrutador de LLM que reduce costes hasta un 30%

Ramp presenta Router: un enrutador inteligente de modelos de lenguaje que reduce costes hasta un 30% en producción La fintech estadounidense Ramp ha presentado oficialmente Ramp Router, una herramienta de enrutamiento de modelos de lenguaje (LLM) diseñada para optimizar automáticamente el coste, la

Comparar modelos de IA por precio por millón de tokens es engañoso

Elegir un modelo de lenguaje por su tarifa por millón de tokens puede disparar la factura de IA de una empresa sin que esta lo perciba. Dos razones explican el desajuste. Primero, cada laboratorio usa un tokenizador propio: el mismo fragmento de este artículo, por ejemplo, se trocea en 160 tokens pa

Una factura de IA en un día costó más que un mes de servidores

Un ingeniero heredó un servicio en producción construido por un ejecutivo no técnico con ayuda de un asistente de código basado en modelos de lenguaje. Al revisar la gráfica de consumo de la API de IA, descubrió que un solo día concentraba cerca de la mitad de la factura mensual y superaba el coste

Burn: descubre qué está quemando tu presupuesto en Kubernetes

Burn es una herramienta de línea de comandos diseñada para analizar y optimizar el gasto en clústeres de Kubernetes, sin necesidad de agentes, almacenamiento persistente o configuración compleja. Se instala con brew, un binario, Docker o Helm, y ejecuta un solo comando para obtener un desglose compl

CodeGraph reduce las llamadas a herramientas y los costes en asistentes IA

CodeGraph es una herramienta de código abierto que genera un grafo de conocimiento de código pre-indexado para potenciar asistentes de codificación basados en inteligencia artificial, como Claude Code, Cursor, Codex, OpenCode, Hermes Agent, Gemini, Antigravity y Kiro. Su objetivo principal es reduci

Claude Code: Usuarios ahorran un 90% con código abierto

Usuarios de Claude, el modelo de lenguaje de Anthropic, están reduciendo significativamente sus costos al integrar Claude Code con Ollama, una plataforma de código abierto, según un tutorial publicado en GitHub por Coherence-Daddy. La técnica permite ejecutar tareas intensivas de programación, como

Claude: Nuevo tokenizador eleva costos de procesamiento

Simon Willison ha actualizado su herramienta 'Claude Token Counter' para permitir la comparación del conteo de tokens entre diferentes modelos de inteligencia artificial de Anthropic, incluyendo Opus 4.7, Opus 4.6, Sonnet 4.6 y Haiku 4.5. La actualización es relevante porque el modelo Opus 4.7 intro

Empresas ahorran migrando a servidores: nuevo servicio innovador

Una nueva empresa ha lanzado un servicio innovador que promete migrar la infraestructura de nube de las empresas a servidores bare-metal, compartiendo los ahorros generados. La propuesta, presentada por cloudexit.pro, se basa en un modelo de pago único: la empresa solo paga el 20% de la reducción re