Inception ha presentado Mercury 2.5, la segunda generación de su modelo de lenguaje por difusión (dLLM) orientada a cargas de producción con restricciones de latencia. La compañía afirma que se trata del mayor modelo de lenguaje por difusión entrenado hasta la fecha y del más capaz del mercado en su categoría, con un salto del 40 % en inteligencia frente a Mercury 2 y un rendimiento equiparable al de modelos frontier optimizados en coste como GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite y Claude Haiku 4.5.
Mercury 2.5 genera 1.107 tokens por segundo sobre GPUs NVIDIA de uso general, maneja contextos de 260.000 tokens y se ofrece a 0,20 dólares por millón de tokens de entrada y 0,75 por millón de salida, con un descuento de lanzamiento del 80 % que deja los precios en 0,04 y 0,15 dólares respectivamente. Incorpora razonamiento ajustable, llamadas paralelas a herramientas y salida JSON alineada con esquema.
Según la empresa, su bajo coste y latencia lo hacen atractivo para agentes de búsqueda, RAG, voz y asistentes de programación, donde cada interacción puede encadenar decenas de llamadas al modelo. OpenCall, que construye agentes telefónicos con IA, redujo la latencia P99 a un segundo y la mediana a 170 milisegundos tras adoptar Mercury. Augment Code recortó un 82 % la latencia y un 90 % el coste en tareas de compactación de contexto y búsqueda de herramientas MCP.
Junto al modelo principal, Inception avanza Mercury Voice, un dLLM optimizado para voz con TTFT inferior a 170 ms, y Mercury Router, que enruta las peticiones hacia el modelo más adecuado en calidad, velocidad o coste. Inception también anunció que ya entrena su próximo modelo, de mayor tamaño, con vistas a lanzarlo en los próximos meses.
