Ornith-1.5 es una nueva familia de modelos de inteligencia artificial de código abierto que amplía el marco de auto-mejora presentado en Ornith-1.0 hasta convertirlo en un bucle completo: el propio modelo propone nuevas tareas, genera andamios (instrucciones, herramientas y estrategias de orquestación) adaptados a cada una y produce soluciones mediante rollouts que alimentan el aprendizaje por refuerzo. Como resultado, el sistema crea de forma continua experiencias de entrenamiento adicionales a partir de las cuales evoluciona, sin depender de un conjunto fijo de tareas curadas por humanos. La familia se ofrece en tres escalas: 397.000 millones de parámetros en arquitectura de mezcla de expertos (MoE), 35.000 millones también MoE y 9.000 millones densa. En la versión insignia, Ornith-1.5-397B alcanza 86,1 puntos en Terminal-Bench 2.1 y 56 en DeepSWE, igualando a Claude Opus 4.8 (85,0 y 59,0) y superando a GLM-5.2 (82,7 y 46,2) y DeepSeek-V4-Flash-0731 (82,7 y 54,4). La variante de 35B, pese a activar solo 3.000 millones de parámetros por token, mejora a Qwen 3.6-35B en todas las pruebas de programación y capacidad agéntica, y aventaja con margen a Gemma 4-31B y a Muse Glimmer-30B (68,5 frente a 43,4 y 51,7 en Terminal-Bench 2.1; 79,0 frente a 52,0 y 76,0 en SWE-Bench Verified). La versión compacta de 9B, disponible también en formato cuantizado para móviles, obtiene 47,0 en Terminal-Bench 2.1 y 70,6 en SWE-Bench Verified, igualando o superando a modelos mucho mayores como Gemma 4-31B y Qwen 3.6-35B. La recompensa de tarea combina tres señales —validez, dificultad en la frontera de capacidad y novedad— y se propaga a la generación de preguntas, a la construcción de andamios y a la producción de soluciones, todo optimizado con GRPO. Esto crea un currículo que evoluciona con el modelo y que ajusta automáticamente las estrategias de resolución a medida que este mejora.
