VectorWare logra ejecutar Rust SIMD sobre la GPU

VectorWare ha anunciado que su toolchain permite ejecutar código Rust escrito con la API portable de SIMD (core::simd) directamente sobre la GPU, sin requerir anotaciones específicas de GPU en el código fuente. La compañía describe la técnica como una novedad sin precedentes que aprovecha el modelo

La CPU recupera protagonismo en la inferencia de modelos de lenguaje

La arquitectura tradicional de inferencia de modelos de lenguaje asigna a la GPU la mayor parte del cómputo y deja a la CPU en un papel secundario de coordinación. Sin embargo, la irrupción de la IA agéntica y el despliegue de modelos más pequeños y especializados está cuestionando esa división. En

RDNA 5 será la última arquitectura de su clase y dará paso a UDNA

Un nuevo rumor indica que AMD mantiene sus planes de lanzar UDNA como sucesora de RDNA 5, en lo que sería la posición que habría ocupado RDNA 6, un nombre que la compañía no utilizaría. De cumplirse esta hoja de ruta, UDNA llegaría en 2029, dado que RDNA 5 está prevista para 2027 y se empleará tanto

La manía de la IA: de los tulipanes a los tokens

Un ensayo reflexivo traza un paralelismo entre la fiebre especulativa del tulipán en los Países Bajos del siglo XVII, la fiebre del oro digital ligada a las GPU que sostienen la minería de criptomonedas y la actual fiebre de los modelos de lenguaje. El autor recupera la lectura coevolutiva de Michae

vLLM-Kunlun: el plugin de Baidu para ejecutar vLLM en la XPU Kunlun

vLLM-Kunlun es un plugin de hardware mantenido por la comunidad y publicado por Baidu que permite ejecutar el motor de inferencia vLLM sobre la XPU Kunlun (chip Kunlun3 P800). El proyecto se distribuye como un plugin estándar de la plataforma vLLM mediante entry points de Python, lo que evita modifi

Una técnica basada en texturas para evaluar curvas Bézier en la GPU

Muhammad Anas y Alan Wolfe presentan en el Journal of Computer Graphics Techniques (JCGT) un método para evaluar curvas Bézier en la GPU que aprovecha el hardware de interpolación lineal de texturas de función fija. Al delegar el cálculo de las curvas al interpolador de texturas, la técnica alivia l

La caja Corsair Frame 4500X RS con cristal panorámico cae 70 dólares

Amazon, Best Buy y Corsair ofrecen durante estos días la caja Corsair Frame 4500X RS a 119,99 dólares, un descuento de 70 dólares frente a su precio habitual. Se trata de una semitorre de cristal panorámico sin costuras que envuelve el frontal y el lateral izquierdo, pensada para montajes con placa

Nadie sabe cuánto vale un clúster de GPU usado

Los préstamos titulizados contra clústeres de GPUs de inteligencia artificial presentan un problema sin precedente en los mercados de deuda: el colateral no funciona sin el equipo humano que lo opera. Si xAI incurriera en impago de su facilidad de crédito de 5.000 millones de dólares firmada en juni

El controlador de Nvidia para Haiku avanza con soporte para GPU Turing y Ampere

Un hilo de discusión en torno al proyecto open source que adapta el controlador de Nvidia para el sistema operativo Haiku recoge los últimos avances de la mano del desarrollador X512. El driver, compilado a partir del código fuente filtrado del motor de Nvidia (nillerusr), ofrece compatibilidad con

Geekbench 7 llega con pruebas más exigentes para CPU y GPU y soporte para AV1

Primate Labs ha presentado Geekbench 7, la nueva generación de su popular herramienta de benchmarking sintético, que incorpora conjuntos de datos más grandes y exigentes para CPU y GPU, pruebas de codificación y decodificación de vídeo y audio inéditas y un test multinúcleo rediseñado. La versión ma

Aprende WebGPU: guía para crear aplicaciones 3D nativas en C++

"Learn WebGPU" es una guía didáctica y en desarrollo que enseña a utilizar la API gráfica WebGPU, especificada por el W3C, para construir aplicaciones 3D nativas en C++ desde cero, compatibles con Windows, Linux y macOS. El material está organizado en bloques modulares —Introducción, Getting Started

Computable: compra horas de GPU por las semanas exactas que necesites

Computable es un mercado donde se pueden comprar, vender y canjear horas de GPU distribuidas en semanas naturales, con liquidez inmediata. A diferencia de los mercados tradicionales de alquiler, que cobran una prima por esa flexibilidad, Computable ofrece las horas a precio mayorista y permite reven

Equivalencias entre tarjetas gráficas y consolas: una historia compartida

Este artículo repasa la relación histórica entre el hardware gráfico de las consolas de videojuegos y las tarjetas gráficas de PC, con el objetivo de establecer equivalencias razonables entre ambas plataformas. El texto comienza en la era 2D de los años ochenta y noventa, una etapa en la que la pote

Un maker construye en casa una GPU con miles de microcontroladores RISC-V

El maker conocido como Bitluni está desarrollando desde su domicilio una máquina gráfica basada en 8.192 microcontroladores RISC-V, cada uno soldado a un LED RGB, en lo que constituye la primera fase de un proyecto mucho más ambicioso. La arquitectura combina en un mismo dispositivo la tarjeta gráfi

Las RTX 50 SUPER reaparecen en la calculadora de SeaSonic sin aval de NVIDIA

Las variantes RTX 50 SUPER de NVIDIA, esperadas desde 2025, han aparecido en la calculadora de fuentes de alimentación del fabricante taiwanés SeaSonic, aunque NVIDIA no ha confirmado oficialmente su existencia ni su lanzamiento. El listado incluye tres modelos: RTX 5080 SUPER, RTX 5070 Ti SUPER y R

Decodificación especulativa: por qué la profundidad supera al ancho en GPU

Este análisis técnico de Doubleword examina un dilema habitual en la inferencia de modelos de lenguaje: cuando se busca aumentar el rendimiento por segundo en una sola GPU, ¿conviene aumentar el tamaño de lote (ancho) o apostar por la decodificación especulativa (profundidad)? El trabajo parte de un

Investigación sobre el subsistema gráfico de Linux

Un usuario documenta su proceso de aprendizaje del funcionamiento interno del sistema gráfico de Linux, empezando por dibujar un triángulo con la GPU y trazando el código a través de Mesa3D, GLFW, OpenGL, Vulkan, Wayland y DRM de Linux. El autor explica que evitaba los problemas de controladores grá

Anatomía del bucle de entrenamiento en PyTorch: cada línea y sus errores

Construir un bucle de entrenamiento en PyTorch parece sencillo, pero colocar cada instrucción en el orden correcto resulta sorprendentemente frágil: los entrenamientos fallan al converger, arrojan resultados incorrectos o consumen memoria excesiva cuando una línea está mal ubicada. Este artículo des

La ISA no importa donde cuenta de verdad: el bloqueo x86 frente a la GPU

El bloqueo de la arquitectura x86 en servidores es real, pero su influencia se debilita conforme nos acercamos a la GPU. Este análisis examina cinco sockets o posiciones que orbitan el procesador gráfico en los sistemas de IA, y evalúa en cuáles la elección entre x86 y Arm resulta determinante y en

Qwen local frente a Opus: una herramienta distinta, no inferior

Un fundador y mantenedor de software comparte su experiencia de uso continuado con modelos Qwen locales (27B y 35-A3B) en su empresa, que mantiene proyectos como OpenFaaS, SlicerVM, Actuated e Inlets, todos escritos en Go y centrados en infraestructura. El autor matiza la afirmación de que Qwen loca

Refrigeración óptica: la promesa de enfriar chips con luz láser

La refrigeración óptica se perfila como una alternativa a los sistemas mecánicos actuales para disipar el calor en chips y centros de datos, que consumen alrededor del 36 % de su electricidad en climatización, según el informe 2024 del Uptime Institute. La técnica se basa en un láser de baja energía

Gram Newton-Schulz acelera el optimizador Muon en modelos de lenguaje

El optimizador Muon se ha consolidado como una herramienta clave para el entrenamiento de modelos de lenguaje de última generación como Kimi K2 o GLM-5, ya que requiere menos pasos que AdamW para alcanzar una misma pérdida. Sin embargo, cada paso de Muon es más costoso debido a su procedimiento de o

Anatomía de un kernel de paralelismo de expertos de alto rendimiento

Los modelos de lenguaje de gran tamaño (LLM) requieren coordinar muchas GPUs para funcionar. Una de las técnicas clave es el paralelismo de expertos (EP), esencial en los modelos MoE a gran escala. A diferencia de otras formas de paralelismo, cuyas comunicaciones siguen patrones fijos, en EP el rout

Conversión exacta de UNORM8 a coma flotante: dos multiplicaciones bastan

Los formatos UNORM8 almacenan un valor en el intervalo [0, 1] como un entero sin signo de 8 bits en GPUs. La conversión exacta a coma flotante consistiría, en aritmética exacta, en dividir el entero por 255. Sin embargo, la especificación funcional de D3D11.3 desaconseja exigir una precisión de 1/2

¿Dividir entre 255 o entre 256 al normalizar valores RGB?

En el procesamiento de imágenes, al convertir valores enteros de 8 bits a coma flotante surge una duda recurrente: ¿conviene dividir entre 255 o entre 256 con un sesgo de 0,5? El artículo examina ambas fórmulas — `x/255` y `(x+0.5)/256` — y compara sus consecuencias prácticas. La fórmula estándar `

Intel: su nuevo chip de IA será más barato y refrigerado por aire

Intel ha anunciado que enviará antes de fin de año un nuevo chip de inteligencia artificial, 'Crescent Island', que utiliza memoria más barata y refrigeración por aire, frente a las ofertas de Nvidia y AMD, que requieren memoria de alto ancho de banda y refrigeración líquida. La compañía busca así c

NVIDIA prepara su primer procesador para Windows, pero no es su primera CPU

**NVIDIA prepara su primer procesador para Windows, pero no es su primera CPU** **Lead:** NVIDIA ha presentado en el Computex 2026 su nuevo procesador RTX Spark, un SoC ARM diseñado para equipos Windows, marcando su regreso al mercado de CPUs para consumo. Sin embargo, aunque muchos lo consideran s

Alibaba presenta el chip Zhenwu M890 para competir con Nvidia

Alibaba ha presentado el chip Zhenwu M890, una GPU diseñada por su filial T-Head, que alcanza un rendimiento de 0,6 petaflops en FP16 y cuenta con 144 GB de memoria HBM3. La compañía también ha lanzado el conmutador ICN Switch, que permite enlazar hasta 128 GPU M890 para que trabajen como un único c

Cedana automatiza la migración de GPUs para IA y HPC

Cedana, una startup que acaba de salir de Y Combinator, ha presentado una solución para la migración automática de GPUs en entornos de Inteligencia Artificial y Computación de Alto Rendimiento (HPC). La empresa busca mitigar los problemas de escasez de infraestructura y los costos elevados asociados

Kog AI alcanza 3.000 tokens/s en GPUs estándar con inferencia en tiempo real

Kog AI ha lanzado una vista previa técnica de su motor de inferencia, demostrando que las tarjetas gráficas estándar pueden alcanzar velocidades de generación de tokens de hasta 3.000 por segundo. El sistema, probado en configuraciones de 8 tarjetas AMD MI300X y NVIDIA H200, logra estos rendimientos

Estudio: GPUs aceleran matrices con datos predecibles en lugar de aleatorios

Un estudio reciente revela que las multiplicaciones de matrices en GPUs, específicamente en la Nvidia A100, se ejecutan más rápido cuando se utilizan datos 'predecibles' como ceros en lugar de datos aleatorios. Esta anomalía desafía la creencia tradicional de que el rendimiento de las operaciones de

El modelo de precios planos en IA llega a su fin

El modelo de precios planos en inteligencia artificial está llegando a su fin. Microsoft canceló licencias internas de Claude Code, Uber agotó su presupuesto de IA para 2026 en apenas cuatro meses y GitHub eliminará sus planes de tarifa fija en todos sus productos. La llamada ‘era del subsidio de IA

Librería Haskell optimiza cálculos de arrays de alto rendimiento

El proyecto Data.Array.Accelerate, desarrollado por el equipo AccelerateHS, es una librería Haskell que define un lenguaje embebido especializado para cálculos de arrays de alto rendimiento. Esta herramienta permite expresar computaciones sobre arrays multidimensionales regulares mediante operacione

Nueva herramienta encuentra el mejor LLM para tu hardware

El desarrollador Andyyyy64 ha publicado en GitHub la herramienta 'whichllm', diseñada para ayudar a los usuarios a encontrar el modelo de lenguaje grande (LLM) más adecuado para su hardware específico. La aplicación detecta automáticamente las características del sistema (GPU, CPU, RAM) y ordena los

nvidia y unsloth aceleran el entrenamiento de IA

Nvidia y Unsloth han colaborado para acelerar el entrenamiento de modelos de lenguaje grandes (LLM) en un 25%, según un anuncio reciente. La optimización se centra en la eliminación de cuellos de botella ocultos en el proceso de entrenamiento, específicamente en tareas de metadatos y la reutilizació

IA: Nvidia impulsa modelos con mayor contexto

La capacidad de los modelos de inteligencia artificial para mantener conversaciones coherentes se ve limitada por el "contexto de ventana", la cantidad de información que pueden procesar simultáneamente. Aunque los modelos actuales pueden manejar entre 128.000 y más de un millón de tokens, su rendim

Super ZSNES: El emulador de SNES renace con mejoras

Los desarrolladores originales de ZSNES han anunciado el lanzamiento de SUPER ZSNES, un emulador de Super Nintendo Entertainment System (SNES) completamente reescrito desde cero. El emulador, disponible para descarga, promete una mayor precisión en los núcleos de CPU y audio, así como un núcleo PPU

Utilyze: Herramienta revela el uso real de GPUs en IA

Una nueva herramienta de código abierto llamada Utilyze, desarrollada por Systalyze, busca solucionar un problema generalizado en la industria de la inteligencia artificial: la medición engañosa de la utilización de las GPU. Las métricas estándar, proporcionadas por herramientas como nvidia-smi, nvt

Apple Silicon: GPU y WebAssembly comparten memoria

Apple ha habilitado una innovadora técnica de inferencia de GPU sin copia en sus chips Silicon, permitiendo que los módulos WebAssembly (Wasm) compartan directamente su memoria lineal con la GPU. Tradicionalmente, la comunicación entre Wasm y la GPU implicaba costosas copias de datos a través de un

IA: Escasez de recursos frena el avance tecnológico

La industria de la inteligencia artificial enfrenta por primera vez en más de dos décadas una escasez significativa de recursos, especialmente de potencia computacional. El precio del alquiler de chips Nvidia Blackwell ha aumentado un 48% en dos meses, alcanzando los 4,08 dólares por hora, y CoreWea

Rust ahora en GPU: VectorWare anuncia avance

VectorWare ha anunciado un hito significativo en el desarrollo de la programación de GPU: la capacidad de utilizar los hilos estándar de Rust (std::thread) directamente en la GPU. Esto representa un avance crucial hacia su visión de crear una empresa de software nativa para GPU que permita a los des

DaVinci Resolve: Corrección de color pro para fotos

Blackmagic Design ha lanzado una nueva función llamada 'Photo page' en DaVinci Resolve, que integra herramientas de corrección de color de Hollywood directamente en el software de edición de fotografía. Esto permite a fotógrafos y coloristas aplicar técnicas avanzadas de gradación de color a imágene

Computadoras zettaflop: ¿un futuro posible?

El artículo "¿Alguna vez tendré una computadora zettaflop?" explora la ambiciosa meta de poseer una computadora con una capacidad de procesamiento de un zettaflop (10^21 FLOPS), y los desafíos técnicos y económicos que implica. Para poner esto en perspectiva, un exaflop es ya una cantidad considerab

30 años de GPUs: Una línea de tiempo interactiva

El artículo "Every GPU That Mattered" (Las GPUs que Importaron) de sheets.works presenta una herramienta interactiva que recorre la evolución de las tarjetas gráficas (GPUs) durante los últimos 30 años, desde 1994 hasta la actualidad. Su objetivo principal es ofrecer una visualización clara y compar

zml-smi: monitoriza GPUs, TPUs y NPUs en una sola herramienta

Una nueva herramienta de código abierto llamada `zml-smi` ha sido lanzada para monitorizar GPUs, TPUs y NPUs de forma universal. Desarrollada por ZML, esta utilidad combina funcionalidades de `nvidia-smi` y `nvtop`, ofreciendo información en tiempo real sobre el rendimiento y la salud del hardware.

Ataques Rowhammer: Control total de PCs con Nvidia

Investigadores han descubierto dos nuevos ataques de tipo Rowhammer que permiten a un usuario malicioso obtener control de raíz en máquinas que utilizan tarjetas gráficas de alto rendimiento de Nvidia. Estos ataques explotan la creciente susceptibilidad de la memoria DRAM a los 'bit flips', donde lo

Lemonade: IA local, rápida y privada para todos

Lemonade, una nueva herramienta de código abierto, ha sido lanzada para facilitar la ejecución local de modelos de inteligencia artificial en computadoras personales. La plataforma, disponible para Windows, Linux y macOS (en versión beta), busca democratizar el acceso a la IA al ofrecer una solución

Paisajes virtuales realistas: nueva técnica de erosión

Un desarrollador ha presentado una nueva técnica para generar paisajes virtuales con apariencia de erosión, inspirada en trabajos previos de Clay John y Felix Westin (Fewes) en la plataforma Shadertoy. La técnica, desarrollada durante ocho meses, simula la apariencia de valles y crestas creadas por

Gráficos 3D en el navegador: JAX impulsa la innovación

Un desarrollador ha logrado implementar un renderizador de ray-marching en navegadores web utilizando la biblioteca JAX de Google. Esta innovadora demostración, publicada en benoit.paris, permite generar imágenes 3D directamente en el navegador a través de código Python, aprovechando la capacidad de

IA: la memoria de las conversaciones tiene un costo

La forma en que los modelos de lenguaje grandes (LLM) como ChatGPT gestionan la memoria de las conversaciones, conocida como 'KV cache', tiene un costo físico y económico significativo. Cada interacción, incluso una pregunta sencilla, se traduce en datos almacenados en la memoria de la GPU, con GPT-

Ingeniero crea sistema RAG interno con LLM

Este artículo narra la experiencia de un ingeniero al construir un sistema de Recuperación Aumentada de Generación (RAG) interno para su empresa, utilizando un modelo de lenguaje grande (LLM) local. El objetivo era crear una herramienta de chat que permitiera a los ingenieros acceder rápidamente a i

GPU Mali: Firmware revela detalles del procesador Cortex-M7

Investigaciones recientes sobre el firmware de las GPU Mali (como la Mali-G610 en el RK3588) han revelado detalles importantes sobre su funcionamiento interno. El firmware se ejecuta en un microcontrolador (MCU) Cortex-M7 que opera a una velocidad impresionante de 990 MHz en el RK3588. Este MCU gest

Flash-KMeans: K-Means Veloz para Sistemas Online

El algoritmo K-Means es una técnica fundamental en aprendizaje automático para agrupar datos similares. Tradicionalmente, se ha utilizado para tareas como organizar conjuntos de datos o preprocesar incrustaciones (embeddings), pero su aplicación en tiempo real, en sistemas online, ha sido limitada p

Nvidia lanza Gluon: más potencia para GPUs

NVIDIA ha presentado Gluon, una extensión del lenguaje y compilador Triton diseñada para mejorar el rendimiento de las GPU. Gluon ofrece un mayor control a los desarrolladores al exponer más detalles internos del compilador, permitiendo optimizaciones más precisas y un mayor potencial de rendimiento

Unsloth Studio: IA fácil con su interfaz sin código

Unsloth AI ha lanzado Unsloth Studio (Beta), una interfaz de usuario web de código abierto y sin necesidad de programación para entrenar, ejecutar y exportar modelos de IA de código abierto localmente. La herramienta, disponible para Windows, Linux, WSL y MacOS (con soporte limitado para entrenamien

Algoritmo Slug: Revolución en la renderización de texto

El 'Algoritmo Slug' es una técnica innovadora para renderizar fuentes directamente desde curvas de Bézier en la GPU, desarrollada a partir de 2016 y formalizada en un artículo científico en 2017. Su éxito radica en la capacidad de generar texto de alta calidad, sin depender de mapas de texturas prec

Control por voz local: la alternativa a Google Assistant

Este artículo describe el viaje de un usuario (Crzynik) para crear un asistente de voz local y fiable en su hogar, utilizando Home Assistant. La motivación principal fue la creciente insatisfacción con Google Assistant (debido a su rendimiento decreciente y preocupaciones de privacidad) y el deseo d

Gráficos 3D: Nuevos Algoritmos Revolucionan la Renderización

Un nuevo avance en gráficos 3D está revolucionando la renderización a través del uso de Campos de Distancia Firmados (SDFs). Los SDFs, una técnica matemática para definir objetos 3D, permiten combinar y manipular formas de manera sencilla, abriendo la puerta a la creación de escenas complejas genera

IonRouter: IA rápida y económica con nueva plataforma

IonRouter ha lanzado una nueva plataforma para la inferencia de inteligencia artificial (IA) de alto rendimiento y bajo costo. La plataforma, impulsada por la tecnología IonAttention, permite a los equipos ejecutar múltiples modelos de IA, incluyendo Vision-Language Models (VLMs), en una sola GPU, o

ia facilita el cambio de estilos de fuentes chinas

Investigadores han desarrollado "zi2zi-JiT", un nuevo modelo de inteligencia artificial que simplifica la transferencia de estilos de fuentes chinas. Basado en el modelo JiT (Just image Transformer), zi2zi-JiT permite generar caracteres en una fuente específica a partir de un carácter fuente y una r

Microsoft acelera IA: nuevo framework para modelos de lenguaje

Microsoft ha lanzado BitNet, un framework de código abierto diseñado para ejecutar modelos de lenguaje de 1 bit (LLM) de manera eficiente en CPUs y GPUs. Esta tecnología permite ejecutar modelos de lenguaje grandes, como un modelo de 100 mil millones de parámetros, en una sola CPU, alcanzando veloci

IA optimiza GPUs: nuevo agente agiliza el rendimiento

RightNow AI ha presentado AutoKernel, un agente de inteligencia artificial que automatiza la optimización de kernels de GPU, inspirándose en el trabajo de autoresearch de Andrej Karpathy. AutoKernel toma cualquier modelo PyTorch, identifica los kernels de cuello de botella, los optimiza de forma aut

ffmpeg-over-ip: Acelera servidores multimedia sin complicaciones

Un nuevo sistema, denominado 'ffmpeg-over-ip', simplifica la aceleración por GPU para servidores multimedia, eliminando la complejidad asociada a la configuración tradicional. Desarrollado por Steelbrain y disponible en GitHub, esta herramienta permite a los servidores multimedia aprovechar la poten

Eyot: Nuevo Lenguaje Facilita Programación de GPU

Un nuevo lenguaje de programación llamado Eyot ha sido desarrollado para simplificar el uso de GPUs y aceleradores en tareas computacionales. Creado por Steele Duncan de Cowley fornia Studios, Eyot busca eliminar la complejidad tradicional de la programación GPU, como la gestión de memoria y la comp

IA al estilo cerebro: ¿fin de las matrices?

Investigadores están reevaluando la dependencia de las redes neuronales artificiales en las matemáticas matriciales, inspirándose en cómo funciona el cerebro humano. El artículo explora cómo el cerebro procesa la información a través de una combinación de percepción de arriba hacia abajo (predicción

CPU innovadora opera dentro de una GPU

Investigadores han desarrollado una CPU innovadora que opera completamente dentro de una GPU, eliminando la necesidad de interacción con la CPU principal del sistema. Este prototipo, denominado NeuralCPU, ejecuta instrucciones ARM64 reales y utiliza tensores de PyTorch para almacenar registros, memo

MacBook Pro M5: Apple eleva el rendimiento al máximo

## MacBook Pro M5: Apple eleva el rendimiento al máximo Apple ha presentado la nueva generación de MacBook Pro, equipada con los chips M5 Pro y M5 Max, prometiendo un salto significativo en rendimiento y capacidades de inteligencia artificial. El anuncio, realizado el 3 de marzo de 2026, marca una

Rust y GPU: Simulaciones Celulares Alcanzan Nueva Velocidad

Un desarrollador ha creado un proyecto en Rust que acelera las simulaciones de autómatas celulares utilizando shaders de GPU. El proyecto, denominado 'Cellarium', permite a los usuarios definir el comportamiento de las células utilizando un subconjunto de Rust, que luego se compila en shaders WGSL p

IA exige: centros de datos apuestan por refrigeración líquida

El auge de la inteligencia artificial está generando una crisis de gestión térmica en los centros de datos, obligando a una transición inevitable hacia sistemas de refrigeración líquida. Según un informe de syaala.com, el aumento exponencial en la densidad de potencia de las GPU, impulsado por chips

Chip Taalas acelera Llama 3 con récord de velocidad

Una startup llamada Taalas ha lanzado un chip ASIC que ejecuta el modelo de lenguaje Llama 3.1 8B a una velocidad de inferencia de 17.000 tokens por segundo, lo que equivale a escribir aproximadamente 30 páginas A4 por segundo. La empresa afirma que su chip es 10 veces más barato en costos operativo

llama 70B corre en RTX 3090 con nuevo motor

Un equipo de desarrolladores ha creado un nuevo motor de inferencia de alto rendimiento para modelos de lenguaje grandes (LLM) que permite ejecutar el modelo Llama 70B en una sola tarjeta gráfica RTX 3090. El motor, basado en C++/CUDA, utiliza una técnica de streaming de capas del modelo a través de

Crítica desata debate sobre arquitectura de GPU NVIDIA

Este documento es una crítica contundente a un artículo titulado "Microbenchmarking NVIDIA’s Blackwell Architecture: An in-depth Architectural Analysis", publicado en arXiv. La crítica, escrita por Sophia Wisdom, argumenta que el artículo es fundamentalmente defectuoso y carece de sentido técnico. E

Level of Detail: Optimiza el desarrollo de software

Este artículo explora el concepto de 'Level of Detail' (LoD), originalmente utilizado en gráficos 3D para optimizar el rendimiento renderizando modelos con menos detalle a distancia, y lo aplica al desarrollo de software. La idea central es que, al igual que en gráficos, no siempre es necesario tene

Makie revoluciona gráficos: trazado de rayos en tiempo real

Investigadores de Makie.org han anunciado el lanzamiento de RayMakie y Hikari, nuevas herramientas que integran el trazado de rayos (ray tracing) basado en física directamente en la plataforma de visualización Makie. Esto permite generar imágenes fotorrealistas de escenas 3D complejas, eliminando la

Nvidia cambia estrategia: ¿más potencia FP64 en GeForce?

Nvidia está reevaluando el rendimiento de doble precisión (FP64) en sus GPUs, marcando un cambio significativo en su estrategia de segmentación de mercado. Durante más de 15 años, la compañía ha reducido deliberadamente el rendimiento FP64 en sus GPUs de consumo (GeForce) en comparación con sus GPUs

BarraCUDA: CUDA en AMD GPUs, sin intermediarios

Un desarrollador ha creado BarraCUDA, un compilador de código abierto que permite ejecutar código CUDA en GPUs de AMD. El proyecto, escrito en C99 sin dependencia de LLVM, traduce archivos .cu directamente a código máquina GFX11 para GPUs AMD RDNA 3. Esto elimina la necesidad de capas de traducción

Rust en GPU: Async/await facilita la programación

VectorWare ha anunciado un hito significativo en la programación de GPU: la capacidad de utilizar las características `async/await` de Rust directamente en la GPU. Esto representa un avance importante hacia la visión de la empresa de facilitar a los desarrolladores la creación de aplicaciones de alt

Ocr sin servidor: 40 líneas de código lo hacen posible

Un desarrollador ha creado un sistema de Reconocimiento Óptico de Caracteres (OCR) sin servidor utilizando un modelo de código abierto, DeepSeek OCR, en tan solo 40 líneas de código. La solución, implementada a través de la plataforma Modal, permite procesar documentos PDF, incluso aquellos con nota

Linux 7.0: Rendimiento y Novedades Clave Analizadas

Un análisis exhaustivo del próximo kernel de Linux 7.0 revela mejoras significativas en rendimiento, gráficos, CPU y redes. Según el canal SavvyNik, las actualizaciones incluyen optimizaciones de código heredado (alrededor de 30-40 años), mejoras en el Intel TSX, cambios en el programador de CPU pre

Redes Neuronales Revolucionan el Renderizado Gráfico

Este artículo explora la aplicación de redes neuronales, específicamente Multilayer Perceptrons (MLPs), en el campo del renderizado gráfico. Tradicionalmente, las redes neuronales se han utilizado para tareas como antialiasing y escalado, pero esta publicación se centra en experimentos más recientes

IA Codifica en la Nube: 'cloudrouter' Agiliza el Desarrollo

Una nueva herramienta llamada 'cloudrouter' ha sido lanzada para potenciar agentes de codificación con IA, como Claude Code y Codex, permitiéndoles crear y gestionar entornos de desarrollo en la nube. La herramienta, disponible como una habilidad para agentes de IA o como una interfaz de línea de c

Gato resuelve fallo en IA de imágenes

Este artículo narra una experiencia inusual: la resolución de un problema técnico en Stable Diffusion gracias a la intervención de un gato. El autor, un desarrollador, estaba experimentando con Stable Diffusion, una herramienta de generación de imágenes por inteligencia artificial que se ejecuta loc

Tyr: Controlador de GPU en Rust impulsa gráficos en Arm

Un equipo de desarrolladores ha logrado un avance significativo en el desarrollo de un controlador de GPU en Rust para hardware Arm Mali, denominado Tyr. En 2025, el equipo demostró la capacidad de ejecutar el juego de carreras de código abierto SuperTuxKart en una conferencia, marcando un hito impo

Simulador optimiza entrenamiento de IA y reduce uso de memoria

Investigadores han desarrollado un nuevo simulador para optimizar el uso de la memoria durante el entrenamiento de modelos de aprendizaje automático. La herramienta, presentada el 8 de febrero de 2026, modela el proceso de entrenamiento como una tubería simplificada con tres etapas: carga de datos e

Texturizado Virtual: El Truco de PS1 que Inspira Gráficos Hoy

Un artículo explora el origen y la relevancia de la técnica de 'texturizado virtual', inicialmente implementada en Crash Bandicoot para PlayStation como una solución para optimizar el uso de memoria limitada. El equipo de desarrollo, al no poder cargar todos los assets en la memoria RAM, implementó