llama.cpp publica la versión v0.1.0

El proyecto de código abierto llama.cpp, mantenido por la organización ggml-org en GitHub, ha publicado la versión v0.1.0, marcada con el commit 7c35571. El repositorio, que cuenta con más de 124.000 estrellas y 21.800 bifurcaciones, es una implementación en C/C++ diseñada para ejecutar modelos de l

Cómo alcanzar 50 tokens/s con Qwen3 27B y 256K de contexto en una GPU de 24 GB

El ingeniero Michał Piszczek documenta el proceso seguido para ejecutar el modelo denso Qwen3 27B con su contexto nativo completo de 262.144 tokens, entrada multimodal y decodificación especulativa MTP sobre una sola GPU NVIDIA RTX PRO 4000 Blackwell SFF de 24 GB. El sistema final, bautizado Qwen3.8

Qwen3.8-27B: galería de demos generadas el día del lanzamiento

Qwen3.8-27B es un modelo de inteligencia artificial presentado con una galería curada de demos generadas el mismo día de su publicación. Cada tarjeta de la colección enlaza a una página web autocontenida que ilustra un caso de uso distinto: desde jardines de vóxeles con pagodas hasta rejillas 'bento

Qwen3.8-27B en formato GGUF: guía de uso local con llama.cpp, Ollama y Unsloth

Unsloth ha publicado en Hugging Face la versión GGUF del modelo Qwen3.8-27B, una variante densa de 27.000 millones de parámetros con comprensión nativa de imágenes y vídeo, control flexible del modo de razonamiento y mejoras en la ejecución autónoma de tareas largas. El repositorio incluye cuantizac

NVIDIA publica Nemotron 3.5 Lightning 30B-A3B en cuantización NVFP4

NVIDIA ha presentado Nemotron 3.5 Lightning 30B-A3B en cuantización NVFP4, una variante optimizada para inferencia de su familia de modelos de lenguaje abiertos. El lanzamiento, fechado el 11 de agosto de 2026 según la ficha técnica publicada en Hugging Face, supone un paso más en la estrategia de l

Needle 2: un LLM agentic de 14 MB para dispositivos diminutos

Cactus Compute ha presentado Needle 2, un modelo de lenguaje abierto de 45 millones de parámetros orientado a la llamada de herramientas, el control de dispositivos y la extracción estructurada de datos. Todo el modelo cabe en un único binario de 14 MB y ejecuta una sesión completa usando unos 28 MB

Empaquetando el razonamiento latente como modelo completo

DeepSeek-V4-Flash-0731-Latent-Reasoning convierte un adaptador experimental de razonamiento en espacio latente en un modelo autosuficiente listo para producción. El autor publica en HuggingFace un único repositorio con todos los pesos necesarios: el backbone DeepSeek-V4-Flash-0731 cuantizado a NVFP4

Más allá de un solo número: cómo elegir un modelo cuantizado para despliegue

La empresa ByteShape ha publicado una serie de tres artículos técnicos en los que propone un marco práctico para evaluar modelos de inteligencia artificial cuantizados de cara a su puesta en producción. El texto parte de una crítica a la forma habitual de comparar estos modelos: mediante una única c

Cómo ejecutar GLM-5.2 en local con los GGUF dinámicos de Unsloth

GLM-5.2, el nuevo modelo abierto de Z.ai, ya puede ejecutarse en hardware local gracias a las cuantizaciones GGUF dinámicas de Unsloth, disponibles desde el día de lanzamiento. Se trata de un modelo de 744.000 millones de parámetros con 40.000 millones activos y una ventana de contexto de un millón