DeepSeek V4 Pro 0813: precios, proveedores y métricas en OpenRouter

La ficha de OpenRouter para el modelo DeepSeek V4 Pro 0813 funciona como una guía práctica para desarrolladores e integradores. El modelo lo aloja un único proveedor y OpenRouter reenvía cada petición de forma directa, sin lógica de enrutamiento intermedia. En el apartado de precios se muestra tant

La francesa Kog quiere exprimir más rendimiento de las GPU mediante software

La startup francesa Kog, fundada en solitario por Gaël Delalleau, asegura que es posible acelerar drásticamente la inferencia de modelos de inteligencia artificial en GPU estándar mediante optimización por software, frente a quienes consideran necesarias soluciones de hardware a medida como los chip

Llama.app, el hogar oficial de llama.cpp para ejecutar IA en local

Llama.app se presenta como la página oficial del proyecto de código abierto llama.cpp, una iniciativa pensada para ejecutar modelos de inteligencia artificial de frontera directamente en el ordenador del usuario, sin depender de servicios en la nube, claves de API ni telemetría. Toda la información

AMD MI355X supera en rendimiento por dólar al servir Kimi K3

Wafer ha logrado ejecutar el modelo abierto Kimi K3, de 2,8 billones de parámetros, en un nodo de ocho GPUs AMD MI355X con 288 GB de VRAM cada una, alcanzando 952 tokens por segundo agregados y 118 tok/s en flujo único. El resultado multiplica por 3,8 el rendimiento agregado por nodo y por 1,3 el de

¿Cuándo merece la pena un puente NVLink?

Dos RTX 3090, un puente NVLink caro y una pregunta: ¿merece realmente la pena para cargas de trabajo de IA? Esta entrada es un benchmark a fondo que intenta responderla. El autor ejecuta cuatro tipos de pruebas: inferencia con partición por capas y paralelismo de tensores (llama-bench con Llama 3.3

High Bandwidth Flash: la memoria NAND que busca alimentar la inferencia de IA

La memoria flash NAND, presente en tarjetas SD, memorias USB y teléfonos inteligentes, podría convertirse en una pieza clave para aliviar la enorme demanda de memoria que generan los grandes modelos de lenguaje. Investigadores y fabricantes trabajan en High Bandwidth Flash (HBF), una evolución que a

libargus: un runtime nativo unificado para inferencia de IA en Java

libargus es un runtime de ejecución de inteligencia artificial nativo, sin gestión de memoria automática y con cero asignaciones de memoria, que consolida en un único proceso global las canalizaciones de visión, habla y modelos de lenguaje. La biblioteca actúa como una capa fina sobre los motores de

Eliminar las burbujas de GPU en la inferencia de IA: pipelined decoding

El equipo de Moondream analiza en profundidad un problema frecuente en la inferencia de modelos de IA: las llamadas burbujas de GPU, periodos en los que el procesador gráfico permanece inactivo porque la CPU aún no le ha indicado la siguiente tarea. El artículo explica por qué aparecen durante el bu

Por qué los costes de la inteligencia artificial caerán antes de lo esperado

El gasto en inteligencia artificial se ha convertido en un problema creciente para empresas de todos los tamaños. Uber agotó el presupuesto anual para IA en apenas cuatro meses, mientras Microsoft, Salesforce y GitHub ya aplican medidas internas para recortar el uso de modelos por parte de sus emple

OpenAI presenta Jalapeño, su primer chip propio de inteligencia artificial

OpenAI ha presentado Jalapeño, su primer procesador de inteligencia artificial diseñado junto a Broadcom para servidores que ejecutan modelos de lenguaje como ChatGPT. Se trata de un ASIC (circuito integrado de aplicación específica) orientado a la fase de inferencia, es decir, al procesamiento de l

MilkV Jupiter 2: la primera placa RISC-V con 16 núcleos y aceleración de IA

El MilkV Jupiter 2 es la primera placa basada en RISC-V que se presenta como un producto acabado, con 16 núcleos asimétricos (ocho Spacemit A100 a 2 GHz y ocho X100 a 2,4 GHz), 32 GB de RAM, conectividad 10GbE, Wi-Fi 6 y una GPU con soporte DRM. Fabricado por Radxa, el sistema incluye almacenamiento

Estudio empírico revela que la blockchain Pearl no realiza inferencia de IA

Una investigación sometida a arXiv el 3 de junio de 2026 examina empíricamente a Pearl, una blockchain de capa 1 respaldada públicamente por figuras relevantes del sector de la inteligencia artificial. El trabajo cuantifica, por primera vez, la distancia entre lo que la red promete y lo que realment

Groq capta 650 millones pese a la licencia de su tecnología a Nvidia

Groq está captando 650 millones de dólares en una nueva ronda de financiación, según informó Axios, apenas cinco meses después de que Nvidia licenciara la tecnología de inferencia de la empresa y fichara a sus principales ingenieros. La operación, en una valoración aún no revelada, ha sorprendido al

Intel: su nuevo chip de IA será más barato y refrigerado por aire

Intel ha anunciado que enviará antes de fin de año un nuevo chip de inteligencia artificial, 'Crescent Island', que utiliza memoria más barata y refrigeración por aire, frente a las ofertas de Nvidia y AMD, que requieren memoria de alto ancho de banda y refrigeración líquida. La compañía busca así c

Sistema Stratum combina DRAM 3D apilada para acelerar inferencia de modelos MoE

La propuesta de Stratum es un sistema de diseño conjunto hardware‑software que busca acelerar la inferencia de modelos de inteligencia artificial del tipo Mixture‑of‑Experts (MoE) mediante el uso de memorias DRAM monoliticas apiladas en 3D organizadas en varios niveles de capacidad y ancho de banda.