Poolside ha presentado Laguna S 2.1, un modelo de lenguaje de tipo Mixture-of-Experts con 118 000 millones de parámetros totales y 8 000 millones activados por token, que admite una ventana de contexto de hasta un millón de tokens en los modos de razonamiento y sin razonamiento. El entrenamiento, desde su inicio hasta el lanzamiento, duró menos de nueve semanas, y la compañía publica junto al modelo la totalidad de las trayectorias de evaluación en trajectories.poolside.ai.
Según los benchmarks publicados, Laguna S 2.1 alcanza un 70,2 % en Terminal-Bench 2.1, un 78,5 % en SWE-Bench Multilingual, un 59,4 % en SWE-Bench Pro y un 40,4 % en DeepSWE, situándose como el modelo agentic de codificación más capaz de su categoría de tamaño y superando a varios modelos de tamaño muy superior. En el benchmark DeepSWE, orientado a tareas de ingeniería de software de mayor horizonte, Laguna S 2.1 obtiene 40,4 puntos en modo thinking dentro del harness propio de Poolside, mientras que algunos modelos abiertos de más de un billón de parámetros se quedan por debajo del 10 %.
Poolside destaca tres casos de estudio prácticos con trayectorias íntegras: la construcción de un motor de renderizado HTML/CSS en JavaScript a partir de una carpeta vacía durante una sesión de 50 minutos y 181 pasos sin intervención humana; la optimización del propio harness agentic de la compañía, con una mejora del 5,2 % en velocidad y una reducción cercana al 70 % en uso de memoria; y la disponibilidad pública de todas las trayectorias de evaluación como medida de transparencia frente al habitual reward hacking en benchmarks agentic. El modelo se ofrece con distintos niveles de thinking effort para ajustar el equilibrio entre coste y capacidad de razonamiento.
