El desarrollador slvDev ha publicado en GitHub el proyecto esp32-ai, un modelo de lenguaje de 28,9 millones de parámetros capaz de generar texto directamente sobre un microcontrolador ESP32-S3, un chip de bajo costo —alrededor de 8 dólares— sin enviar datos a ningún servidor externo. El sistema escribe cada palabra en una pequeña pantalla conectada al chip a una velocidad aproximada de 9 tokens por segundo y ocupa 14,9 MB en cuantización de 4 bits.
El truco para que un modelo de este tamaño quepa en un hardware tan limitado reside en una idea de Google llamada Per-Layer Embeddings (PLE), procedente de las familias Gemma 3n y Gemma 4. En lugar de cargar todo el modelo en la memoria rápida SRAM —apenas 512 KB en el ESP32-S3—, el proyecto deja 25 millones de parámetros en una tabla de embeddings almacenada en la memoria flash, que es lenta pero espaciosa. Para cada token generado se leen únicamente unas pocas filas —alrededor de 450 bytes—, mientras que la pequeña parte del modelo que realiza el cómputo real permanece en SRAM. El resultado es un modelo cien veces mayor que el anterior récord en un chip similar (260.000 parámetros), según explica el autor.
El modelo fue entrenado con el conjunto de datos TinyStories, creado por Ronen Eldan y Yuanzhi Li en Microsoft Research, por lo que solo escribe relatos cortos y coherentes: no responde preguntas, sigue instrucciones ni escribe código. El propio repositorio señala que el mérito está en la arquitectura y en el ajuste del modelo a un chip diminuto, no en las capacidades lingüísticas del sistema. El firmware, el cableado y los pasos de carga están documentados en firmware/esp32_llm/README.md, y los detalles técnicos, las ablaciones y las mediciones se recogen en RESULTS.md.
