Cómo exprimir varias GPU de desecho para ejecutar modelos de IA en casa

Este artículo explica, desde una perspectiva práctica y accesible, cómo aprovechar varios GPU reciclados para ejecutar modelos de lenguaje de gran tamaño en un servidor doméstico. Tras una introducción al funcionamiento básico de los transformers y al concepto de token, el texto repasa por qué la ge

Gestión de VRAM (2): cómo sobrevivir cuando se supera la memoria física

El autor, desarrollador del driver gráfico AMD en Linux, retoma su serie sobre gestión de VRAM tras el desembarco en el kernel principal de los parches anunciados a principios de año. La entrada anterior dejó una afirmación pendiente: los juegos deberían mantenerse estables siempre que no consuman m

GeForce RTX 5060 de 8 GB supera a la RTX 3060 de 12 GB en 1080p

La GeForce RTX 3060 ha regresado al mercado en su versión con 12 GB de memoria gráfica, reavivando el debate sobre la cantidad de VRAM y planteando la duda de si conviene elegirla frente a una GeForce RTX 5060, equipada con 8 GB. Este análisis compara ambas tarjetas gráficas para resolver la cuestió

nbd-vram: usa la VRAM de tu GPU NVIDIA como swap en Linux

nbd-vram es una herramienta de código abierto que convierte la VRAM de una GPU NVIDIA en espacio de swap para Linux, pensada para portátiles con memoria soldada y sin posibilidad de ampliación. El proyecto, publicado por Sean Lobjoit bajo licencia MIT, se dirige a usuarios que cuentan con una tarjet

Puse una GPU de datacenter en mi PC gaming por £200

Un usuario logró duplicar la memoria VRAM de su ordenador de juegos añadiendo una GPU de datacenter Tesla V100 SXM2 por un coste total de unas 200 libras. La necesidad surgió al querer ejecutar localmente modelos de lenguaje grandes (LLM) que requerían más de los 16 GB de su RTX 4080. La solución fu

Nueva librería KVBoost permite ejecutar LLMs grandes con poca VRAM

KVBoost es una nueva librería de código abierto desarrollada por el repositorio Pythongiant que acelera significativamente la inferencia de grandes modelos de lenguaje (LLM) reduciendodrásticamente los requisitos de memoria VRAM. La herramienta解决los principales problemas de rendimiento: los modelos

Chip Taalas acelera Llama 3 con récord de velocidad

Una startup llamada Taalas ha lanzado un chip ASIC que ejecuta el modelo de lenguaje Llama 3.1 8B a una velocidad de inferencia de 17.000 tokens por segundo, lo que equivale a escribir aproximadamente 30 páginas A4 por segundo. La empresa afirma que su chip es 10 veces más barato en costos operativo

Simulador optimiza entrenamiento de IA y reduce uso de memoria

Investigadores han desarrollado un nuevo simulador para optimizar el uso de la memoria durante el entrenamiento de modelos de aprendizaje automático. La herramienta, presentada el 8 de febrero de 2026, modela el proceso de entrenamiento como una tubería simplificada con tres etapas: carga de datos e