WebLLM: motor de inferencia de LLM en el navegador con aceleración WebGPU

Fuentes: WebLLM: high-performance in-browser LLM inference engine with WebGPU

WebLLM es un motor de inferencia de modelos de lenguaje de gran tamaño que ejecuta la carga de trabajo directamente en el navegador web, sin necesidad de servidor, gracias a la aceleración por hardware mediante WebGPU. El proyecto, publicado como repositorio de código abierto por MLC AI, ofrece una interfaz plenamente compatible con la API de OpenAI, lo que permite reutilizar sobre modelos abiertos funcionalidades como streaming, modo JSON, control a nivel de logits o seeding.

La herramienta se distribuye como paquete npm (@mlc-ai/web-llm), también instalable mediante Yarn o pnpm, y puede importarse directamente a través de CDN en entornos como JSFiddle, CodePen o Scribbler. Soporta de forma nativa familias de modelos como Llama 3, Llama 2, Phi 3 y Phi 2, Gemma-2B, Mistral-7B-v0.3 y sus variantes Hermes y NeuralHermes, así como Qwen2 en sus versiones de 0.5B, 1.5B y 7B, y permite además integrar modelos propios compilados en formato MLC.

WebLLM incorpora generación estructurada en JSON implementada en WebAssembly para mejorar el rendimiento, streaming de completions de chat en tiempo real, soporte para Web Workers y Service Workers, y compatibilidad con extensiones de Chrome. Ofrece cuatro backends de caché (Cache API, IndexedDB, Origin Private File System y la experimental Cross-Origin Storage API) y expone una API minimalista y modular con la función CreateMLCEngine para crear instancias del motor y cargar modelos. Es un proyecto complementario de MLC LLM, la iniciativa de MLC AI orientada al despliegue universal de LLM en distintos entornos硬件.