LFM2.5-2.6B es un modelo de lenguaje de la familia LFM2.5 desarrollada por Liquid AI, diseñado para ejecutarse en local sobre dispositivos con recursos limitados. La arquitectura híbrida combina 22 bloques de convolución de doble puerta con 8 capas de atención grouped-query (GQA), suma 2.690 millones de parámetros en 30 capas y se entrenó con 34 billones de tokens. Soporta una ventana de contexto de 131.072 tokens y un vocabulario de 128.000 entradas, y está disponible en 16 idiomas, entre ellos español, inglés, chino, árabe, francés, alemán, japonés y coreano.
El modelo se ofrece en dos variantes: LFM2.5-2.6B-Base, sin ajustar, pensado para fine-tuning, y LFM2.5-2.6B, con post-entrenamiento agentivo. En pruebas de la compañía, alcanza 220 tokens por segundo en un Apple M5 Max y 113 tokens por segundo en una CPU AMD Ryzen, con un consumo de memoria inferior a 2,5 GB. Según Liquid AI, su rendimiento en uso de herramientas, seguimiento de instrucciones y tareas agentivas de varios pasos compite con modelos hasta cuatro veces más grandes.
Se distribuye en cuatro formatos: el checkpoint original en formato nativo, la versión GGUF cuantizada para llama.cpp e inferencia en CPU, la compilación ONNX para despliegue multiplataforma y la versión MLX para chips Apple Silicon. Es compatible con Transformers, vLLM, SGLang y Docker Model Runner, e incorpora generación con razonamiento mediante etiquetas y plantilla tipo ChatML. Sus usos recomendados incluyen flujos agentivos, llamada a herramientas, extracción de datos, RAG y tareas de contexto largo, mientras que no se aconseja para generación de código agentiva ni para tareas intensivas en conocimiento.
