SubQ presenta 1.1 Small, un modelo con atención subcuadrática para contextos de hasta 12 millones de tokens

Fuentes: SubQ unveils 1.1 Small, a subquadratic attention model for contexts up to 12M tokens

La empresa detrás de SubQ ha presentado la ficha técnica de SubQ 1.1 Small, la segunda iteración de su modelo de atención dispersa subcuadrática (SSA), en su tamaño más reducido. La compañía está desplegando el modelo con un grupo selecto de socios de diseño y prevé lanzar a lo largo del año una familia más amplia con ventanas de contexto de entre 2 y 12 millones de tokens.

SubQ 1.1 Small está entrenado principalmente a 1 millón de tokens y, según la compañía, alcanza una recuperación casi perfecta en pruebas de aguja en un pajar (NIAH) a 1M, 2M, 6M y 12M tokens, comprimiendo la atención al 0,13 % de las relaciones. En el test RULER de Nvidia obtiene un 99,12 % a 128K. En razonamiento general, alcanza 85,4 % en GPQA Diamond, 89,7 % pass@4 en LiveCodeBench v6 y 13 % en AutomationBench Finance, situándose por encima de modelos pequeños y cerca de la frontera en programación competitiva.

La arquitectura SSA sustituye la atención densa O(n²) por una formulación dispersa que escala de forma lineal con la longitud del contexto. A 1 millón de tokens, SubQ requiere 64,5 veces menos cómputo que la atención densa y es 56 veces más rápido que FlashAttention-2 en una capa de atención. La compañía señala casos de uso como análisis financiero y due diligence, trabajo jurídico sobre contratos extensos y razonamiento a nivel de arquitectura sobre repositorios de código completos. Los resultados fueron verificados de forma independiente por Appen.