vLLM v0.28.0 optimiza inferencia de Kimi-K3 y DeepSeek V4

El proyecto vLLM ha publicado la versión 0.28.0, una actualización que incorpora 584 contribuciones de 270 desarrolladores para mejorar significativamente el rendimiento y la compatibilidad de modelos de lenguaje avanzados. Esta liberación se centra en optimizaciones profundas para Kimi-K3, incluyen

Nvidia lleva CUDA al ecosistema RISC-V con requisitos de servidor

Nvidia trabaja en portar su plataforma de cómputo CUDA a sistemas con CPU RISC-V, según expuso en la conferencia Hot Chips 2026. Hasta ahora CUDA solo funcionaba con procesadores x86-64 y aarch64; el nuevo objetivo son CPUs RISC-V de grado servidor que cumplan con el perfil RVA23 y las especificacio

Por qué tu LLM local parece más torpe de lo que es

Muchos usuarios instalan un modelo de lenguaje local, a menudo en una versión cuantizada, y comprueban decepcionados que rinde peor de lo prometido en los benchmarks originales. Esta brecha se explica porque cada combinación de hardware y software introduce pequeñas variaciones que alteran los cálcu

Cómo una GPU lee memoria: el recorrido de una instrucción de carga

Este artículo técnico sigue paso a paso el viaje que realiza una instrucción de carga global (LDG.E) generada por un kernel CUDA de suma vectorial en una GPU NVIDIA RTX 4090, desde que se ejecuta en un warp hasta que llega —si llega— a la DRAM. El recorrido comienza cuando el planificador de una sub

Por qué los turnos son mejor unidad angular que los radianes

Este artículo técnico sostiene que, en el código de programación, sustituir π por τ (2π) fue una mejora menor comparada con la posibilidad de eliminar directamente los radianes. El autor argumenta que la práctica habitual de multiplicar valores por π o τ para llamar a las funciones trigonométricas y

Geolocalización OSINT de un islote mediante geometría y CUDA

Un autor publica un writeup detallado del reto OSINT 'Gralhix #004', creado por Sofia Santos, en el que se pide identificar un resort situado en un islote tropical a partir de una sola fotografía aérea obtenida con un dron. En lugar de recurrir a Google Lens, el autor plantea una resolución basada í

Swizzling de memoria compartida en CUDA: evitar conflictos de banco

Los kernels CUDA que usan memoria compartida pueden sufrir conflictos de banco, una penalización de rendimiento habitual cuando un warp accede simultáneamente a posiciones que caen en el mismo banco de la memoria compartida. Una solución sencilla es el padding, pero desperdicia memoria y tiene otros

Pantheon: pruebas de GPU y gestión de caché

Pantheon es una herramienta para evaluar el comportamiento de las GPU mediante cargas de trabajo enfocadas. El texto describe pruebas de cómputo, memoria, caché, interconexión y consumo energético, junto con la captura de telemetría y el almacenamiento de resultados para compararlos posteriormente.

La francesa Kog quiere exprimir más rendimiento de las GPU mediante software

La startup francesa Kog, fundada en solitario por Gaël Delalleau, asegura que es posible acelerar drásticamente la inferencia de modelos de inteligencia artificial en GPU estándar mediante optimización por software, frente a quienes consideran necesarias soluciones de hardware a medida como los chip

Por qué las abstracciones de código empiezan a jubilarse

En mayo de 2025, el equipo de HazyResearch y de Cursor describió su trabajo con megakernels para acelerar el modelo Llama, una técnica que obliga a coordinar manualmente cientos de hilos y bloques de GPU. Para hacer manejable esa complejidad, desarrollaron una capa de abstracción en C++ publicada en

VectorWare logra ejecutar Rust SIMD sobre la GPU

VectorWare ha anunciado que su toolchain permite ejecutar código Rust escrito con la API portable de SIMD (core::simd) directamente sobre la GPU, sin requerir anotaciones específicas de GPU en el código fuente. La compañía describe la técnica como una novedad sin precedentes que aprovecha el modelo

Ferrox: un motor de inferencia en Rust que rivaliza con llama.cpp

Ferrox, un motor de inferencia escrito íntegramente en Rust, ejecuta modelos de lenguaje abiertos en local —tanto densos como Mixture-of-Experts— sobre CPU, Apple Metal o CUDA, sin recurrir a enlaces con llama.cpp ni con ggml. Cada kernel, cargador y mecanismo de planificación se ha implementado des

Un repositorio lleva Nix y NixOS al superordenador personal DGX Spark de NVIDIA

El proyecto de código abierto nixos-dgx-spark, publicado en GitHub por el usuario graham33, ofrece una vía oficial para ejecutar Nix y NixOS en el superordenador personal NVIDIA DGX Spark, un equipo compacto orientado a cargas de inteligencia artificial que también se comercializa como Asus Ascent G

Geekbench 7 llega con nuevos bancos de prueba para CPU y GPU

Primate Labs ha presentado Geekbench 7, la nueva versión de su benchmark multiplataforma, ya disponible para Android, iOS, Windows, macOS y Linux. La herramienta incorpora cargas de trabajo de medios inéditas que evalúan el rendimiento de la CPU en tareas de codificación, decodificación y procesamie

transcribe.cpp: nueva biblioteca de transcripción local basada en ggml

transcribe.cpp es una biblioteca de transcripción de voz a texto basada en ggml, presentada por el autor y mantenedor de Handy como un proyecto de código abierto en su versión 0.1.0. Su objetivo es simplificar la distribución de aplicaciones de reconocimiento automático del habla (ASR) multiplatafor

Spectral Compute quiere liberar a CUDA del hardware de Nvidia

Spectral Compute, una empresa londinense fundada en 2018 por cuatro ingenieros con 60 años de experiencia combinada en optimización para HPC, desarrolla SCALE, un compilador basado en CLang y LLVM que funciona como sustituto directo de NVCC, el compilador CUDA de Nvidia. La herramienta permite recom

Anatomía de un kernel CUDA: del código en C al silicio de la GPU

Ejecutar un kernel aparentemente trivial —sumar dos vectores de un millón de floats— esconde una cadena de traducciones y movimientos de datos que este artículo recorre paso a paso. El programa fuente, escrito en CUDA C, se divide en dos ramas: el código del host lo compila el compilador habitual de

Eliminar las burbujas de GPU en la inferencia de IA: pipelined decoding

El equipo de Moondream analiza en profundidad un problema frecuente en la inferencia de modelos de IA: las llamadas burbujas de GPU, periodos en los que el procesador gráfico permanece inactivo porque la CPU aún no le ha indicado la siguiente tarea. El artículo explica por qué aparecen durante el bu

nanoeuler: un LLM estilo GPT-2 construido desde cero en C y CUDA

nanoeuler es un proyecto educativo e investigador que implementa un modelo de lenguaje tipo GPT-2 desde cero, sin recurrir a PyTorch, autograd ni librerías de aprendizaje automático. Todo el pipeline de entrenamiento —el forward, el backward, un tokenizador byte-level BPE escrito a mano, el preentre

Anatomía del bucle de entrenamiento en PyTorch: cada línea y sus errores

Construir un bucle de entrenamiento en PyTorch parece sencillo, pero colocar cada instrucción en el orden correcto resulta sorprendentemente frágil: los entrenamientos fallan al converger, arrojan resultados incorrectos o consumen memoria excesiva cuando una línea está mal ubicada. Este artículo des

Polar Signals presenta muestreo de PC en CUDA de bajo coste para producción

Polar Signals ha incorporado soporte de muestreo de contador de programa (PC) sobre NVIDIA CUDA a su perfilador continuo de código abierto, publicado en la versión v0.48.0 de Parca Agent. La técnica, basada en CUPTI y disponible desde la arquitectura Maxwell, registra en hardware la posición de inst

La ISA no importa donde cuenta de verdad: el bloqueo x86 frente a la GPU

El bloqueo de la arquitectura x86 en servidores es real, pero su influencia se debilita conforme nos acercamos a la GPU. Este análisis examina cinco sockets o posiciones que orbitan el procesador gráfico en los sistemas de IA, y evalúa en cuáles la elección entre x86 y Arm resulta determinante y en

Montaje RTX 5080 + RTX 3090: más de 80 tokens/s con Qwen 3.6 27B Q8

El usuario describe cómo configurar dos GPUs NVIDIA, una RTX 5080 (16 GB) y una RTX 3090 (24 GB), para ejecutar modelos de lenguaje locales de gran tamaño, específicamente Qwen 3.6 27B en cuantización Q8. La combinación alcanza más de 80 tokens por segundo en inferencia al distribuir el trabajo entr

OpenCL y sus alternativas: lecciones de la democratización fallida

El artículo, quinta entrega de la serie "Democratizing AI Compute", escrito por Chris Lattner (cofundador de Modular), analiza por qué OpenCL y otros modelos de programación de GPU portátiles (como SYCL, oneAPI) fracasaron en convertirse en plataformas dominantes para la inteligencia artificial, a p

Cómo implementar operaciones personalizadas en PyTorch con C++ y CUDA

Esta entrada del blog explica cómo implementar operaciones personalizadas en PyTorch utilizando C++ y CUDA, y cómo integrarlas tanto en modelos de PyTorch como en programas de inferencia compilados con AOTInductor. El ejemplo guía es una convolución identidad mínima que ilustra el ciclo completo: de

nbd-vram: usa la VRAM de tu GPU NVIDIA como swap en Linux

nbd-vram es una herramienta de código abierto que convierte la VRAM de una GPU NVIDIA en espacio de swap para Linux, pensada para portátiles con memoria soldada y sin posibilidad de ampliación. El proyecto, publicado por Sean Lobjoit bajo licencia MIT, se dirige a usuarios que cuentan con una tarjet

RTX Spark: el superchip de NVIDIA para portátiles y sobremesas ultrafinos

NVIDIA entra de lleno en la carrera por la IA personal con el RTX Spark, un superchip que promete convertir a los ordenadores Windows en verdaderas máquinas de inteligencia artificial local. El anuncio fue realizado por el consejero delegado de la compañía, Jensen Huang, durante una conferencia pron

Presentamos Surface Laptop Ultra: diseñado para los creadores del mundo

Microsoft presenta el Surface Laptop Ultra: la apuesta más ambiciosa de la línea Surface para creadores, desarrolladores y profesionales de la inteligencia artificial. Anunciado en el marco del Computex 2026, el nuevo equipo es fruto de una colaboración profunda entre Microsoft, NVIDIA y, según repo

Jmaczan lanza tiny-vllm, motor educativo de inferencia LLM

El desarrollador Jmaczan ha lanzado en GitHub 'tiny-vllm', un motor de inferencia de alto rendimiento para modelos de lenguaje grande (LLM) desarrollado en C++ y CUDA. Esta iniciativa se presenta como una versión más compacta y educativa de vLLM, diseñada para derivar desde cero las matemáticas y ar

Domina la programación CUDA con los mejores libros del mercado

Esta lista curada reúne los mejores libros de programación CUDA, la plataforma de NVIDIA para computación paralela en GPUs. CUDA permite aprovechar la enorme capacidad de procesamiento paralelo de las tarjetas gráficas para tareas de alto rendimiento que antes requerían clusters costosos. La colecci

Librería Haskell optimiza cálculos de arrays de alto rendimiento

El proyecto Data.Array.Accelerate, desarrollado por el equipo AccelerateHS, es una librería Haskell que define un lenguaje embebido especializado para cálculos de arrays de alto rendimiento. Esta herramienta permite expresar computaciones sobre arrays multidimensionales regulares mediante operacione

Nuevo compilador permite escribir kernels para GPUs NVIDIA con Rust puro

cuda-oxide es un compilador experimental que permite escribir kernels (fragmentos de código ejecutados en paralelo por miles de hilos) para GPUs NVIDIA utilizando Rust puro, sin necesidad de aprender un lenguaje específico de dominio ni usar extensiones externas. Este proyecto funciona como un backe

30 años de HPC: Evolución y desafíos

Este artículo reflexiona sobre los 30 años de evolución de la computación de alto rendimiento (HPC) y la programación asociada, basándose en datos del ranking TOP500 de sistemas HPC y la evolución de los lenguajes y modelos de programación utilizados.

Entrenan LLM gigante en una GPU: avance tecnológico

El entrenamiento de modelos de lenguaje grandes (LLMs), como GPT-3 o LaMDA, es un desafío computacional enorme. Estos modelos pueden tener cientos de miles de millones de parámetros, lo que requiere una cantidad significativa de memoria y potencia de cálculo. Tradicionalmente, el entrenamiento de es

Eyot: Nuevo Lenguaje Facilita Programación de GPU

Un nuevo lenguaje de programación llamado Eyot ha sido desarrollado para simplificar el uso de GPUs y aceleradores en tareas computacionales. Creado por Steele Duncan de Cowley fornia Studios, Eyot busca eliminar la complejidad tradicional de la programación GPU, como la gestión de memoria y la comp

ZSE: Motor optimiza LLMs y reduce el uso de memoria

Un nuevo motor de inferencia para modelos de lenguaje grandes (LLM) llamado ZSE ha sido desarrollado para reducir drásticamente los requisitos de memoria, según un anuncio reciente en GitHub. Creado por Zyora-Dev, ZSE permite ejecutar modelos de lenguaje de gran tamaño con una huella de memoria sign

llama 70B corre en RTX 3090 con nuevo motor

Un equipo de desarrolladores ha creado un nuevo motor de inferencia de alto rendimiento para modelos de lenguaje grandes (LLM) que permite ejecutar el modelo Llama 70B en una sola tarjeta gráfica RTX 3090. El motor, basado en C++/CUDA, utiliza una técnica de streaming de capas del modelo a través de

Crítica desata debate sobre arquitectura de GPU NVIDIA

Este documento es una crítica contundente a un artículo titulado "Microbenchmarking NVIDIA’s Blackwell Architecture: An in-depth Architectural Analysis", publicado en arXiv. La crítica, escrita por Sophia Wisdom, argumenta que el artículo es fundamentalmente defectuoso y carece de sentido técnico. E

BarraCUDA: CUDA en AMD GPUs, sin intermediarios

Un desarrollador ha creado BarraCUDA, un compilador de código abierto que permite ejecutar código CUDA en GPUs de AMD. El proyecto, escrito en C99 sin dependencia de LLVM, traduce archivos .cu directamente a código máquina GFX11 para GPUs AMD RDNA 3. Esto elimina la necesidad de capas de traducción

Nueva técnica acelera cálculos complejos con GPUs

El artículo de Bee Rosa Davis presenta una innovadora técnica llamada 'Curvature-Guided Wavefront Execution' (Ejecución de Frente de Onda Guiada por Curvatura) que revoluciona la resolución de problemas de satisfacción de restricciones (CSP) utilizando la potencia de las GPUs. En esencia, se trata d