Liquid AI ha presentado LFM2.5-VL-DSpark, un modelo de decodificación especulativa diseñado para optimizar el rendimiento de los modelos de lenguaje de visión (VLM) de 3.000 millones de parámetros. Esta herramienta permite acelerar la inferencia mediante un mecanismo de decodificación especulativa que añade 280 millones de parámetros adicionales, representando un aumento del 8,9% sobre el modelo base, sin comprometer la calidad de la salida.
El sistema logra mejoras significativas en la velocidad de decodificación: hasta 3,13 veces más rápido en dispositivos locales y 2,66 veces más rápido en GPUs H100. En términos de latencia total, las mejoras oscilan entre 1,56 y 2,62 veces en hardware de borde, como el M5 Max, y entre 1,64 y 2,27 veces en GPUs de centro de datos. La arquitectura del drafter utiliza una atención simplificada de 4 capas y un tamaño de bloque de 9, entrenado con datos de SFT de visión y lenguaje.
El modelo incluye soporte nativo desde el primer día para llama.cpp, MLX-VLM y SGLang, facilitando su integración en entornos de inferencia. Aunque la decodificación especulativa acelera el procesamiento de tokens, su impacto en la latencia total está limitado por la ley de Amdahl, ya que la codificación de imágenes y el prefill siguen siendo cuellos de botella en dispositivos de borde. Liquid AI ofrece el modelo en formatos Safetensors y GGUF, destacando su enfoque en la accesibilidad y la ejecución de IA en diversos dispositivos.
