PrismML lanza Bonsai 2 27B con compresión de 9x y 98% de rendimiento

Fuentes: PrismML releases Bonsai 2 27B with 9x compression and 98% performance retention

PrismML ha presentado Bonsai 2 27B, un modelo de inteligencia artificial multimodal que logra una compresión casi sin pérdidas de rendimiento al reducir su huella de memoria a solo 5,9 GB, una fracción de los 51 GB del modelo original Qwen3.8 27B. Esta nueva versión, basada en pesos ternarios {−1, 0, +1} con escalado por grupos en FP16, permite ejecutar modelos de 27B en dispositivos locales sin sacrificar capacidades críticas. El modelo retiene el 98,2% del rendimiento agregado del modelo de precisión completa, manteniendo la capacidad de razonamiento, codificación, visión y uso de herramientas agénticas. En pruebas de benchmarks, Bonsai 2 27B alcanza una puntuación general de 83,9, superando a versiones anteriores de la serie Bonsai. La optimización técnica incluye una ventana de contexto de 262.000 tokens y soporte para entrada multimodal de texto e imagen. En términos de eficiencia, el modelo alcanza un throughput de hasta 143 tokens por segundo en GPUs NVIDIA GeForce RTX 5090 y consume solo 0,714 mWh por token en RTX 4090, lo que lo hace un 40% más eficiente energéticamente que un modelo de 8B en precisión completa. Disponible bajo licencia Apache 2.0, Bonsai 2 27B facilita la implementación de agentes de IA locales para tareas sensibles o de alta frecuencia, reduciendo la dependencia de la nube y optimizando el uso de recursos en dispositivos personales y centros de datos.