WebLLM: motor de inferencia de LLM en el navegador con aceleración WebGPU

WebLLM es un motor de inferencia de modelos de lenguaje de gran tamaño que ejecuta la carga de trabajo directamente en el navegador web, sin necesidad de servidor, gracias a la aceleración por hardware mediante WebGPU. El proyecto, publicado como repositorio de código abierto por MLC AI, ofrece una

Slotstream ejecuta un modelo de 104 GB en Mac mediante SSD

Slotstream es una herramienta experimental para ejecutar Qwen3.8-Flash-Next en equipos Mac con mucha menos memoria de la que ocupa el modelo. El original, cuantizado a 4 bits, pesa 103,8 GB y se divide en 24 archivos. En lugar de cargarlo por completo, la aplicación almacena en memoria una selección

Experiential: un gateway open source para unificar modelos de IA

Experiential es un gateway y enrutador de código abierto pensado para flujos de trabajo con agentes de inteligencia artificial. Funciona como una capa de control única que ofrece una API compatible con OpenAI para consumir tanto modelos alojados como modelos locales o personalizados, ya sea mediante

FAAAH: un proxy LLM compatible con OpenAI basado en archivos de texto

FAAAH (Filesystem As An AI Handler) es una herramienta de código abierto que actúa como proxy local compatible con la API de OpenAI y permite reutilizar la suscripción de un agente de programación con IA —como Claude Code u opencode— para alimentar otras aplicaciones que esperan el formato OpenAI. S

Ramp lanza Router, un enrutador de LLM que reduce costes hasta un 30%

Ramp presenta Router: un enrutador inteligente de modelos de lenguaje que reduce costes hasta un 30% en producción La fintech estadounidense Ramp ha presentado oficialmente Ramp Router, una herramienta de enrutamiento de modelos de lenguaje (LLM) diseñada para optimizar automáticamente el coste, la

mnemo: capa de memoria IA local con grafo de conocimiento persistente

mnemo es una capa de memoria local diseñada para dotar a los modelos de lenguaje de gran tamaño (LLM) de memoria persistente sin depender de servicios en la nube. Funciona como un servicio "sidecar" que observa cada conversación, extrae entidades nombradas y relaciones mediante un LLM, construye un