Noticias que mencionan GRPO

Ornith-1.5: un modelo de IA que se mejora a sí mismo sin intervención humana

Ornith-1.5 es una nueva familia de modelos de inteligencia artificial de código abierto que amplía el marco de auto-mejora presentado en Ornith-1.0 hasta convertirlo en un bucle completo: el propio modelo propone nuevas tareas, genera andamios (instrucciones, herramientas y estrategias de orquestaci

Entrenar una sola capa de un transformer basta para replicar el ajuste por RL

Un nuevo estudio de aprendizaje automático cuestiona uno de los supuestos más asentados del post-entrenamiento de modelos de lenguaje: que los beneficios del aprendizaje por refuerzo (RL) se distribuyen de forma pareja entre todas las capas del transformer. Los autores demuestran que entrenar una ún

Dr. GRPO: un kernel 2,2× más rápido en test, 3× más lento integrado

Este artículo describe el proceso de construir, desde cero, un bucle de entrenamiento de aprendizaje por refuerzo (RL) para modelos de lenguaje grandes, aplicándolo al algoritmo Dr. GRPO sobre el modelo Qwen2.5-0.5B-Instruct y la tarea GSM8K, con una sola GPU A10G. El punto de partida es una observa