Guía práctica para aprovechar 8 RTX PRO 6000 en inferencia y ajuste

Un sistema con ocho GPU NVIDIA RTX PRO 6000 Blackwell (96 GB GDDR7 cada una, 768 GB agregados) y un CPU AMD EPYC 9555 (64 núcleos, 128 hilos, Zen 5) ofrece alternativas de alto paralelismo a un coste muy inferior al de las plataformas HGX B200 o B300 con NVLink. El artículo analiza por qué fragmenta

CarWatch: un agente local con IA de 35B en el coche, sin nube ni suscripciones

CarWatch es un proyecto de código abierto que convierte un Raspberry Pi 5 instalado en el coche en un agente conversacional completamente offline, capaz de participar en salas de chat, responder preguntas y avisar de incidentes. La placa ejecuta en local un modelo de 35.000 millones de parámetros (Q

Cómo alcanzar 50 tokens/s con Qwen3 27B y 256K de contexto en una GPU de 24 GB

El ingeniero Michał Piszczek documenta el proceso seguido para ejecutar el modelo denso Qwen3 27B con su contexto nativo completo de 262.144 tokens, entrada multimodal y decodificación especulativa MTP sobre una sola GPU NVIDIA RTX PRO 4000 Blackwell SFF de 24 GB. El sistema final, bautizado Qwen3.8

AirLLM: cómo ejecutar modelos de 70B en una sola GPU de 4 GB

AirLLM es una biblioteca de Python de código abierto que reduce drásticamente el consumo de memoria durante la inferencia de modelos de lenguaje de gran tamaño, permitiendo ejecutar un modelo de 70B parámetros en una única GPU con apenas 4 GB de VRAM, sin recurrir a cuantización, destilación ni poda

Una crítica técnica a OpenCode: fallos de caché y diseño del prompt

Un análisis extenso y crítico del agente de programación OpenCode, la herramienta de código abierto de este tipo más popular en GitHub con 161.000 estrellas. El autor distingue entre problemas molestos —fallos repetidos de caché de prompt al reevaluar el prompt del sistema en cada turno SSE, al poda

Receta de RL en NVFP4 para modelos de lenguaje: el aprendizaje de los 4 bits

El equipo de humans& presenta una receta de aprendizaje por refuerzo (RL) en precisión NVFP4 de 4 bits, desarrollada en colaboración con RadixArk y NVIDIA, que logra mantener la dinámica de entrenamiento en alta precisión y, al mismo tiempo, aprovechar los aumentos de throughput que ofrece el hardwa

El backend de modelado de transformers en vLLM alcanza velocidad nativa

Hugging Face ha anunciado una actualización del backend de modelado de transformers dentro de vLLM que permite ejecutar los modelos de Hugging Face a la misma velocidad —o superior— que las implementaciones nativas escritas a mano para vLLM, sin necesidad de portar el código. La mejora se valida con

Decodificación especulativa: por qué la profundidad supera al ancho en GPU

Este análisis técnico de Doubleword examina un dilema habitual en la inferencia de modelos de lenguaje: cuando se busca aumentar el rendimiento por segundo en una sola GPU, ¿conviene aumentar el tamaño de lote (ancho) o apostar por la decodificación especulativa (profundidad)? El trabajo parte de un

Entrenar una sola capa de un transformer basta para replicar el ajuste por RL

Un nuevo estudio de aprendizaje automático cuestiona uno de los supuestos más asentados del post-entrenamiento de modelos de lenguaje: que los beneficios del aprendizaje por refuerzo (RL) se distribuyen de forma pareja entre todas las capas del transformer. Los autores demuestran que entrenar una ún