Cuantización de Qwen3.8 27B: 4 bits mantiene el rendimiento, 1 bit colapsa

Quesma Blog publica un análisis exhaustivo sobre cómo afecta la cuantización al rendimiento del modelo Qwen3.8 27B en distintas tareas. El modelo completo en BF16 ocupa 55 GB de VRAM, fuera del alcance de la mayoría del hardware de consumo. Los experimentos, ejecutados con llama.cpp sobre GPUs alqui

La frontera eficiente de la inferencia en modelos de lenguaje

La inferencia de modelos de lenguaje (LLM) se gobierna por una frontera eficiente que resume los compromisos entre latencia, rendimiento y coste, un concepto que la industria de la IA tomó prestado de la economía y que mide hasta dónde se puede llegar en capacidad a un coste dado. Este artículo expl

Por qué tu LLM local parece más torpe de lo que es

Muchos usuarios instalan un modelo de lenguaje local, a menudo en una versión cuantizada, y comprueban decepcionados que rinde peor de lo prometido en los benchmarks originales. Esta brecha se explica porque cada combinación de hardware y software introduce pequeñas variaciones que alteran los cálcu

Guía visual de la cuantización: cómo comprimir modelos de lenguaje grandes

La cuantización es una técnica de compresión que reduce el número de bits necesarios para representar los parámetros de un modelo de lenguaje grande (LLM), normalmente almacenados en punto flotante de 32 bits (FP32), a formatos de menor precisión como FP16, BF16 o enteros de 8 bits (INT8). El objeti

INT8 ConvRot: el formato de cuantización que haría innecesario el FP8

INT8 ConvRot es un nuevo método de modelado y cuantización para modelos de IA que llega integrado de forma nativa en ComfyUI a partir de la versión 0.27.0, publicada el 1 de julio de 2026. Se perfila como el nuevo estándar para los modelos cuantizados a 8 bits y está sustituyendo en la práctica a lo

Receta de RL en NVFP4 para modelos de lenguaje: el aprendizaje de los 4 bits

El equipo de humans& presenta una receta de aprendizaje por refuerzo (RL) en precisión NVFP4 de 4 bits, desarrollada en colaboración con RadixArk y NVIDIA, que logra mantener la dinámica de entrenamiento en alta precisión y, al mismo tiempo, aprovechar los aumentos de throughput que ofrece el hardwa

Cómo definir nuevos tipos en JAX con hijax

JAX trabaja de forma natural con arrays y, cuando se necesitan datos agregados, ofrece los pytrees como mecanismo estándar para empaquetar varios arrays en una sola estructura que el sistema aplana y reconstruye de forma transparente. Sin embargo, hay casos en los que esa transparencia resulta contr

Búsqueda semántica en el navegador para un sitio estático

El autor documenta cómo dotó a su blog estático de búsqueda semántica enteramente en el cliente, sin servidor ni API externas. La motivación era cerrar la brecha entre una búsqueda por palabras clave que entiende poco y corre en cualquier sitio, y una búsqueda semántica potente pero incapaz de ejecu

GPT2-BASIC: un transformador en DOS con aritmética de punto fijo

GPT2-BASIC es un runtime de transformer y asistente local implementado en BASIC para máquinas de clase DOS, compilado con FreeBASIC y verificado en QEMU. No es un frontend web ni un envoltorio de API: carga artefactos de modelo desde disco, ejecuta inferencia tipo GPT con aritmética entera de punto

Cuantización entera: fundamentos, unidades MAC y errores de cuantización

La cuantización entera se ha convertido en una técnica clave para ejecutar modelos de lenguaje grandes en hardware de consumo: lo que hace apenas unos años requería GPU de varios gigabytes para un modelo de 7.000 millones de parámetros en INT8, hoy permite cargar un modelo de 70.000 millones en 4 bi

Resolver la ambigüedad del coreano en CPU: 7.300 palabras por segundo sin GPU

Kimchi Reader, una herramienta de aprendizaje de coreano por inmersión, necesitaba desambiguar lemas en libros completos de forma rápida y precisa. El desarrollador encaró el reto con un modelo KoELECTRA-small de 14 millones de parámetros, cuantizado a int8 y ejecutado íntegramente en CPU mediante u

Arquitecturas KAN para aprendizaje automático ultrarrápido en FPGA

Las redes neuronales Kolmogorov-Arnold (KAN) combinan de forma natural con las tablas de consulta (LUT) de las FPGA, los dispositivos de lógica digital reconfigurable que ejecutan redes neuronales directamente como circuitos, no como instrucciones secuenciales. Este artículo explica, de forma didáct

¿Dividir entre 255 o entre 256 al normalizar valores RGB?

En el procesamiento de imágenes, al convertir valores enteros de 8 bits a coma flotante surge una duda recurrente: ¿conviene dividir entre 255 o entre 256 con un sesgo de 0,5? El artículo examina ambas fórmulas — `x/255` y `(x+0.5)/256` — y compara sus consecuencias prácticas. La fórmula estándar `

TQ4_1S: LLMs más pequeños para dispositivos Apple

Un desarrollador ha presentado una nueva técnica de compresión de modelos de lenguaje grandes (LLM) llamada TQ4_1S, diseñada específicamente para dispositivos Apple con chips Metal. Esta técnica reduce el tamaño de los modelos en un 27-38%, dependiendo del modelo, sin necesidad de reentrenamiento ni

Unsloth mejora LLMs con Dynamic 2.0 GGUFs

Unsloth ha lanzado Dynamic 2.0 GGUFs, una actualización significativa de su método de cuantización para modelos de lenguaje grandes (LLMs). Esta nueva versión supera a otros métodos de cuantización líderes, estableciendo nuevos puntos de referencia en pruebas MMLU y KL Divergence, lo que permite a l

ZSE: Motor optimiza LLMs y reduce el uso de memoria

Un nuevo motor de inferencia para modelos de lenguaje grandes (LLM) llamado ZSE ha sido desarrollado para reducir drásticamente los requisitos de memoria, según un anuncio reciente en GitHub. Creado por Zyora-Dev, ZSE permite ejecutar modelos de lenguaje de gran tamaño con una huella de memoria sign

Z.ai Lanza GLM-5: Modelo de Razonamiento Avanzado

Z.ai ha lanzado GLM-5, un nuevo modelo de razonamiento disponible para su ejecución local. Este modelo supera a su predecesor, GLM-4.7, en tareas de codificación, agentes y chat, y está diseñado para el razonamiento con un contexto extenso, mostrando mejoras significativas en benchmarks como Humanit