Cognition, la empresa detrás del agente de programación Devin, presentó SWE-2, su modelo de inteligencia artificial más avanzado para tareas de ingeniería de software, que según la compañía empuja la frontera de Pareto entre capacidad y coste en el segmento de modelos de código.
El anuncio, realizado a través del blog oficial de Cognition, sitúa a SWE-2 en un 50,0% en la prueba FrontierCode 1.1 Main, a solo un punto de Fable 5.1 (50,9%) y a 3,3 puntos del líder GPT-6 Astra (53,3%), pero con un coste un 64% inferior al de Fable 5.1 y una cuarta parte del de GPT-6 Astra. El modelo supera tanto a su antecesor SWE-1.7 (42,0%) como a Grok 4.6 (48,0%) en puntuación y en coste en esa misma evaluación.
El salto respecto a la generación previa es sustancial: en DeepSWE 1.1, SWE-2 alcanza el 73,0%, frente al 37,7% de SWE-1.7, prácticamente doblando el rendimiento de su predecesor. En Terminal-Bench 2.1 obtiene un 92,8% (81,5% de SWE-1.7) y en Terminal-Bench 4 marca un 27,3%, muy por encima del 7,6% previo, aunque todavía lejos del 57,9% de GPT-6 Astra o del 55,8% de Fable 5.1.
Para entrenar el modelo, Cognition aplicó por primera vez aprendizaje por refuerzo (RL) en la escala de multitrillones de parámetros, partiendo de Kimi K3, un modelo base de 2,8 billones de parámetros con un post-entrenamiento RL extensivo para coding agentico. Sobre esa base, SWE-2 ganó entre 5 y 6 puntos adicionales en la mayoría de benchmarks y desplazó por completo la frontera de coste-rendimiento de K3. El avance clave fue un algoritmo de RL que entrena simultáneamente todos los niveles de esfuerzo en una sola ejecución, en lugar de entrenar expertos separados por nivel y luego consolidarlos, como hace Kimi K3.
El método, descrito por Cognition como derivado de primeros principios, emplea una función de recompensa con penalización lineal por coste, calibrada según la pendiente local de la frontera de Pareto del modelo base. Esto permite avanzar la frontera completa de coste-rendimiento sin deformarla y reflejar los costes reales del usuario durante el entrenamiento. Además, se introdujeron baselines de recompensa ponderados por longitud (una mejora sobre los usados desde SWE-1.6) que estabilizan el entrenamiento, y se triplicó el número de entornos de RL.
En cuanto al comportamiento del modelo, Cognition destaca tres patrones observados en pruebas internas. Primero, mayor cobertura de pruebas: SWE-2 escribe tests que verifican implementaciones de extremo a extremo, detectando regresiones y casos límite con mayor fiabilidad. Segundo, mayor ingenio dentro de los límites del usuario: cuando una vía directa está bloqueada, el modelo busca rutas alternativas; en un caso, al no estar disponible una integración MCP que necesitaba, reconstruyó los datos a partir del historial de un canal de Slack al que sí tenía acceso. Tercero, disciplina de verificación: ante un desafío, SWE-2 rederiva conclusiones en lugar de reafirmarlas, contrasta hipótesis del usuario en lugar de asentir y ejecuta artefactos para gathering evidence en lugar de confiar en la prosa superficial.
En eficiencia, los datos son notables: en FrontierCode 1.1 Main, el nivel medio de SWE-2 obtiene mejor puntuación que SWE-1.7 usando un 58% menos de turnos y costando un 81% menos de media. El modelo realiza su primera edición real tras una mediana de 18 pasos, frente a los 48 de SWE-1.7, lo que refleja una exploración más enfocada: el modelo identifica antes qué partes del código importan realmente para cada tarea.
SWE-2 ya está disponible desde el día del anuncio en Devin Desktop y Devin CLI, con despliegue progresivo en Devin Web y en Fusion, la nueva oferta de Cognition para integrar múltiples agentes. La compañía enmarca el lanzamiento como el modelo más cercano a la frontera que ha desarrollado hasta la fecha, capaz de competir con GPT-6 Astra y Fable 5.1 a una fracción de su precio, aunque todavía sin superarlos en todas las métricas.
El lanzamiento llega en un contexto de competencia creciente en el segmento de coding agents, donde OpenAI, Anthropic, xAI, Moonshot (Kimi) y startups como Fable compiten por liderar un mercado donde el coste por tarea resuelta se ha convertido en variable estratégica. El enfoque de Cognition, entrenar todos los niveles de esfuerzo en una sola carrera de RL con penalización de coste informada por la frontera de Pareto, se presenta como alternativa a la estrategia de Kimi de expertos separados destilados en un único modelo.
La siguiente prueba para SWE-2 será su adopción en entornos de producción. Cognition ha publicado su propio leaderboard, FrontierCode, y los datos de benchmark son los principales argumentos comerciales, pero la métrica decisiva serán los resultados reales de desarrolladores y empresas que lo integren en sus flujos de trabajo durante las próximas semanas.
