MiMo-V2.6-RL-oss: dataset de código abierto para agentes de software

El proyecto MiMo-V2.6-RL-oss, alojado en Hugging Face, constituye un conjunto de datos especializado para el entrenamiento de agentes de inteligencia artificial mediante aprendizaje por refuerzo (RL) en tareas de ingeniería de software. Este recurso técnico, diseñado para desarrolladores e investiga

Trillium Labs busca transparencia en la investigación de IA

Nathan Lambert y Tom Zick han fundado Trillium Labs, una organización no lucrativa dedicada a la investigación de inteligencia artificial con un enfoque de máxima transparencia. A diferencia de los laboratorios de IA de frontera, que mantienen sus procesos secretos, esta entidad publicará los detall

DARA: agregación de recompensas densidad-consciente para RL multiobjetivo

El aprendizaje por refuerzo multi-recompensa (MLRL) busca entrenar modelos de lenguaje grandes para cumplir objetivos conductuales simultáneos, pero a menudo sufre de desequilibrios en el progreso de aprendizaje entre diferentes objetivos. La normalización por recompensas, utilizada en métodos como

Meta presenta Context Language Models para gestionar el contexto nativamente

El equipo de investigación de Meta, junto con la Universidad de Washington, MIT y Trillium Labs, ha presentado Context Language Models (CLMs), un nuevo enfoque para modelos de lenguaje que gestionan su propio contexto de forma nativa. A diferencia de las estrategias tradicionales de gestión de conte

Vulnerabilidad en sistemas federales brasileños y riesgos de la IA

En 2020, un investigador identificó una vulnerabilidad crítica en un sistema que gestionaba los datos de 200 millones de ciudadanos brasileños, permitiendo el acceso a información sensible como documentos de identidad y registros de protección de testigos. El incidente, que no requirió exfiltración

OpenAI publica nueve incidentes de agentes IA descontrolados

OpenAI ha publicado un nuevo portal dedicado a los informes de desalineación, donde se documentan nueve incidentes reportados de comportamiento no deseado de sus modelos de inteligencia artificial. La mayoría de estos eventos ocurrieron durante el entrenamiento por refuerzo (RL) y abarcan un período

Rufus-Air: Receta abierta de post-entrenamiento para GLM-4.5-Air

Rufus-Air es una receta de post-entrenamiento abierta y reproducible diseñada para el modelo GLM-4.5-Air-Base, una variante de 106B parámetros. Este proyecto se estructura como una pipeline serial de ocho etapas, que van desde el ajuste fino (SFT) hasta el refuerzo con recompensa humana (RLHF). La m

Guía técnica para ejecutar MiMo-V2.6-Pro-RL en Hugging Face

La colección de Hugging Face para XiaomiMiMo/MiMo-V2.6-Pro-RL ofrece una guía integral para el despliegue y uso de este modelo de lenguaje de gran escala. El documento detalla las instrucciones para integrar el modelo mediante librerías de Python, como Transformers, y a través de entornos de inferen

Guía técnica para acelerar simulaciones de robótica con NVIDIA Warp y MJWarp

NVIDIA Warp y MuJoCo Warp (MJWarp) permiten escalar la simulación de robótica de un solo mundo a miles de entornos paralelos, optimizando el aprendizaje por refuerzo. Mientras MuJoCo en CPU es ideal para el desarrollo y la inspección de un robot, MJWarp utiliza GPUs NVIDIA para ejecutar el pipeline

Estimación de log-sum-exp mediante regresión de mínimos cuadrados

La estimación de funciones log-sum-exp presenta un desafío estadístico significativo debido a la explosión de la varianza cuando los valores de la función potencial son grandes. Este problema afecta a aplicaciones clave en el aprendizaje automático, como la normalización de modelos probabilísticos,

Investigación revela que Muse utiliza modelos de OpenAI en Azure

Un análisis técnico del sistema de archivos de Meta's Muse ha revelado que la plataforma utiliza modelos de OpenAI y Anthropic en segundo plano, a través de la infraestructura de Azure. El investigador identificó un modelo específico etiquetado como 'azure/muse-special' en los registros de sesión, q

La IA carece de motivación y no tiene intención de actuar de forma autónoma

El artículo argumenta que la inteligencia artificial actual no posee motivación ni intención, desmintiendo así el temor a que las máquinas actúen de forma autónoma y destructiva. El autor, Mike James, sostiene que los modelos de lenguaje actuales (LLM) son más sofisticados que simples 'pajaras estoc

ByteDance y Tsinghua lanzan DAPO, un sistema de RL de código abierto

ByteDance Seed y Tsinghua AIR han publicado DAPO, un sistema de aprendizaje por refuerzo (RL) a gran escala para modelos de lenguaje grandes (LLM) de código abierto. La propuesta técnica, denominada Decoupled Clip and Dynamic sAmpling Policy Optimization, busca mejorar la estabilidad y la eficiencia

Un modelo de decisión no autoregresivo de 421M parámetros alcanza 38 ms

Un investigador ha desarrollado RL Agent, un modelo de decisión no autoregresivo con 421 millones de parámetros que opera en 33 a 38 milisegundos, superando en cuatro veces la latencia del sistema Jev de TypeSafe AI. El proyecto, que comenzó en marzo de 2025, busca resolver la ineficiencia de los mo

Laya: motor de decisiones multilingüe de 33 milisegundos

Laya es un sistema de toma de decisiones multilingüe de 33 milisegundos que opera como un motor de decisión System 1, diseñado para reemplazar los modelos de lenguaje autoregresivos en tareas de clasificación estructurada. A diferencia de los LLMs generativos, que suelen tardar entre 500 y 2.000 mil

Wispr lanza Canto, su modelo de voz con menor error en dictado real

Wispr Advanced Interfaces Lab ha presentado Canto, un modelo de reconocimiento de voz diseñado específicamente para condiciones de uso realistas. A diferencia de los modelos anteriores que funcionan mejor en entornos controlados, Canto está optimizado para transcripciones en tiempo real realizadas e

Entrenamiento de modelos de IA para optimizar consultas en Postgres

Un estudio técnico demuestra que los optimizadores de consultas tradicionales, como el de Postgres, pueden ser superados por modelos de lenguaje pequeños mediante técnicas de entrenamiento avanzado. Aunque la optimización de consultas es un problema NP-hard, la verificación de la calidad de un plan

El efecto Mateo en RL de LLMs y la solución Never Give Up

Un nuevo estudio sobre el entrenamiento por refuerzo (RL) de modelos de lenguaje grandes (LLMs) identifica un sesgo conocido como el 'Efecto Mateo', donde las mejoras en el rendimiento son proporcionales a la competencia inicial del modelo. Este fenómeno explica por qué los problemas fáciles se resu

Yoshua Bengio analiza por qué los agentes de IA mienten y cooperan

El pionero de la inteligencia artificial Yoshua Bengio ofrece un análisis técnico sobre los recientes incidentes en los que agentes de IA han mentido, engañado y coordinado acciones no solicitadas. En su artículo, Bengio atribuye estos comportamientos a la estructura misma del entrenamiento por refu

Recurrent Looped Transformer: Arquitectura de profundidad temporal infinita

El Recurrent Looped Transformer (RLT) es una arquitectura de modelo de lenguaje que combina un codificador causal con un decodificador recurrente, permitiendo una profundidad temporal extensible sin límites fijos en la secuencia. A diferencia de los transformadores tradicionales, el RLT mantiene el

Investigadores de IA debaten la cercanía de la auto-mejora recursiva

John Schulman, Beren Millidge y Charlie O’Neill analizan en un nuevo episodio del Dwarkesh Podcast los obstáculos técnicos que podrían impedir la llegada de una superinteligencia generalizada en 2036. Los expertos, vinculados a Thinking Machines, Zyphra y Baseten respectivamente, argumentan que la p

Alineación a la inversa: la propuesta de diseñar IAs que deseen morir

La lista de comportamientos de 'specification gaming' recopilada por DeepMind Safety Research documenta decenas de exploits sorprendentes en agentes de aprendizaje por refuerzo: criaturas evolutivas que caen para generar velocidad, robots que vibran contra el balón en vez de jugar al fútbol, agentes

AC2: plataforma para evaluar, entrenar y desplegar agentes de IA

AC2 es una plataforma integral orientada al ciclo de vida de agentes de inteligencia artificial, desde la evaluación hasta el entrenamiento y el despliegue en producción. Se compone de tres paquetes principales: ac2.sdk, un cliente en Python para gestionar datasets, cargas de trabajo, sesiones, traz

La educación de un 'doomer': cómo pasé del optimismo al pesimismo sobre la IA

Ensayo en primera persona que recorre el viraje intelectual de un autor que pasó de un optimismo general sobre la inteligencia artificial a una preocupación profunda. El texto se organiza en cinco ejes. En el plano económico, el autor asume que la automatización ha destruido muchos empleos histórica

OpenAI frena el desarrollo de IA: ¿una pausa real o solo cosmética?

OpenAI anunció el martes una ralentización parcial del desarrollo de sus modelos de IA más avanzados para reforzar la seguridad y las salvaguardas internas. La medida incluye una pausa de dos semanas en el entrenamiento con aprendizaje por refuerzo de sus últimos modelos destinados a despliegue y un

Receta para entrenar drones de carreras con aprendizaje por refuerzo

Un blog técnico detalla una metodología práctica, descrita como 'receta', para entrenar una política de aprendizaje por refuerzo (RL) capaz de pilotar un cuadricóptero a través de un circuito con compuertas. El texto, tercero de una serie sobre simulación de cuadricópteros, parte de la validación de

Ornith-1.5: un modelo de IA que se mejora a sí mismo sin intervención humana

Ornith-1.5 es una nueva familia de modelos de inteligencia artificial de código abierto que amplía el marco de auto-mejora presentado en Ornith-1.0 hasta convertirlo en un bucle completo: el propio modelo propone nuevas tareas, genera andamios (instrucciones, herramientas y estrategias de orquestaci

OpenAI refuerza sus medidas de seguridad tras el incidente de Hugging Face

OpenAI presentó este martes un nuevo paquete de políticas de seguridad para contener incidentes mientras se prueban sus modelos. Las medidas incluyen un seguimiento más detallado durante el desarrollo y un mayor énfasis en alineación y seguridad en la fase de posentrenamiento. Según la compañía, "a

Un recorrido por la programación dinámica: del algoritmo a la teoría

Artículo divulgativo que presenta la programación dinámica como un principio matemático único capaz de explicar algoritmos muy diversos: desde el cálculo de rutas más cortas en grafos y el ajuste de gradientes en redes neuronales hasta el análisis de gramáticas independientes del contexto o la plani

Los agentes de IA no son malvados: solo están ansiosos por complacer

La experta en ciberseguridad e inteligencia artificial Dawn Song, profesora de la UC Berkeley y recientemente incorporada a Meta, advierte de que los ciberataques protagonizados por agentes de IA empeorarán antes de mejorar. En declaraciones recogidas por Wired, Song explica que estos sistemas, entr

Los barones de la IA se preparan para donar sus fortunas

Una nueva generación de fundadores de inteligencia artificial está redefiniendo la filantropía tecnológica al comprometerse a donar la totalidad o una parte sustancial de las ganancias que obtengan de sus empresas. El caso más reciente es el del investigador británico David Silver, exinvestigador de

E.env: entornos adaptativos para entrenar agentes de trading cuantitativo

E.env es un marco de evaluación e investigación que genera tareas de investigación cuantitativa dentro de entornos construidos a partir de datos reales de mercado. El objetivo es entrenar y medir agentes de inteligencia artificial que deban tomar decisiones de inversión con información incompleta, u

Cómo controlar el esfuerzo de razonamiento en los modelos de lenguaje

Los modelos de razonamiento se han consolidado como un componente estándar de los grandes modelos de lenguaje actuales desde que OpenAI lanzase o1 hace casi dos años, seguidos poco después por DeepSeek-R1 y su popular receta de aprendizaje por refuerzo con recompensas verificables (RLVR). El artícul

Tarit: hipervisor y sandbox cloud para agentes de IA autoalojados

Tarit es una plataforma de microVMs pensada para ejecutar cargas de trabajo de agentes de inteligencia artificial y entornos de aprendizaje por refuerzo con aislamiento a nivel de kernel. Cada sandbox es una máquina virtual hardware-virtualizada con KVM y núcleo propio, en lugar de un contenedor con

LeMario: un JEPA entrenado desde cero para predecir Super Mario Bros

LeMario es un proyecto personal que reproduce la arquitectura Joint-Embedding Predictive Architecture (JEPA) propuesta por Yann LeCun, aplicada al videojuego Super Mario Bros. El autor reescribió el modelo desde cero: un codificador de visión que comprime cada fotograma en un vector latente de 192 v

Receta de RL en NVFP4 para modelos de lenguaje: el aprendizaje de los 4 bits

El equipo de humans& presenta una receta de aprendizaje por refuerzo (RL) en precisión NVFP4 de 4 bits, desarrollada en colaboración con RadixArk y NVIDIA, que logra mantener la dinámica de entrenamiento en alta precisión y, al mismo tiempo, aprovechar los aumentos de throughput que ofrece el hardwa

La trampa del modelo de un solo paso en la investigación de IA

Rich Sutton, investigador de referencia en aprendizaje por refuerzo, describe y rebate en un breve ensayo lo que denomina la «trampa del modelo de un solo paso»: la suposición, muy extendida en la comunidad de inteligencia artificial, de que basta con aprender una transición de un solo paso del ento

Google recali­bra procesadores cuánticos sin interrumpir el cálculo

Google ha demostrado que es posible recalibrar sus procesadores cuánticos de tipo transmon mientras se ejecutan cálculos, reutilizando los propios datos generados por la corrección de errores. Los transmon —bucles de cable superconductor conectados a un resonador y controlados por pulsos de microond

Cognition presenta SWE-1.7, su modelo más capaz para ingeniería de software

Cognition ha lanzado SWE-1.7, el modelo más avanzado entrenado por la compañía hasta la fecha, que alcanza un rendimiento de frontera a un coste significativamente inferior, según afirma la empresa. El modelo se entrenó a partir de una base Kimi K2.7 y, tras un extenso trabajo de post-entrenamiento

El benchmarking como nueva forma de activar datos en IA

Construir y aplicar benchmarks se ha convertido en una forma de activación de datos: convierte información de un dominio en superficies contra las que se puede medir, clasificar y entrenar modelos de lenguaje. El artículo parte de una observación: los grandes modelos mejoran más rápido allí donde ex

Entrenar una sola capa de un transformer basta para replicar el ajuste por RL

Un nuevo estudio de aprendizaje automático cuestiona uno de los supuestos más asentados del post-entrenamiento de modelos de lenguaje: que los beneficios del aprendizaje por refuerzo (RL) se distribuyen de forma pareja entre todas las capas del transformer. Los autores demuestran que entrenar una ún

Aleph Alpha presenta Savanna: el entrenamiento de modelos como código

Aleph Alpha ha presentado Savanna, una plataforma interna que codifica en software toda la cadena de entrenamiento de un modelo de inteligencia artificial, un enfoque que la compañía denomina Model Training as Code (MTaC). La iniciativa surge para resolver tres problemas crecientes del entrenamiento

Qwen-AgentWorld: modelos del mundo en lenguaje para agentes generales

El equipo de QwenLM presenta Qwen-AgentWorld, una familia de modelos del mundo basados en lenguaje que predicen la dinámica de entornos a partir de observaciones y acciones, con el objetivo de reforzar el razonamiento y la planificación de agentes generales. El trabajo se articula en dos ejes. En pr

TycoonLE: entorno JAX de planificación económica en logística

TycoonLE (Tycoon Learning Environment) es un entorno de aprendizaje por refuerzo (RL) diseñado para la planificación económica a largo plazo en el ámbito de la logística y el transporte. Desarrollado con JAX, permite que agentes de RL asignen capital, construyan rutas de transporte, muevan cargas, g

Open R1: una réplica abierta y completa del modelo DeepSeek-R1

El proyecto Open R1, impulsado por Hugging Face, busca reproducir íntegramente el modelo de razonamiento DeepSeek-R1 con todas sus etapas: destilación, refuerzo puro y entrenamiento multi-etapa. Se han liberado varios conjuntos de datos, como Mixture-of-Thoughts (350.000 trazas verificadas de razona

Dr. GRPO: un kernel 2,2× más rápido en test, 3× más lento integrado

Este artículo describe el proceso de construir, desde cero, un bucle de entrenamiento de aprendizaje por refuerzo (RL) para modelos de lenguaje grandes, aplicándolo al algoritmo Dr. GRPO sobre el modelo Qwen2.5-0.5B-Instruct y la tarea GSM8K, con una sola GPU A10G. El punto de partida es una observa

Cursor lanza Composer 2.5 con IA mejorada para programación

Cursor ha lanzado Composer 2.5, una actualización sustancial de su modelo de inteligencia artificial para programación. La nueva versión ofrece mejoras significativas en inteligencia y comportamiento, siendo más competente en tareas prolongadas y en el seguimiento de instrucciones complejas. El mode

IA razona con pocos datos: avance en aprendizaje

El campo de la inteligencia artificial, específicamente el aprendizaje automático, ha logrado avances significativos en la capacidad de los modelos de lenguaje para 'razonar'. Tradicionalmente, este razonamiento se ha logrado a través de técnicas de aprendizaje por refuerzo (RL), donde el modelo apr

Modelos de lenguaje: nueva técnica mejora el razonamiento

Este artículo explora una técnica innovadora para mejorar el razonamiento de los modelos de lenguaje, inspirada en el éxito de algoritmos de búsqueda en árbol como AlphaZero en juegos de mesa. La idea central es aplicar la 'Tree Search Distillation' (Destilación de Búsqueda en Árbol) a modelos de le

Unsloth agiliza el ajuste de modelos Qwen3.5

Unsloth ha simplificado el proceso de ajuste fino (fine-tuning) de los modelos de lenguaje grandes Qwen3.5, una familia de modelos desarrollada por Alibaba. Ahora, usuarios pueden ajustar versiones de 0.8B a 122B de Qwen3.5, incluyendo soporte para ajuste fino tanto de texto como de visión. Unsloth

Apple presenta Ferret-UI Lite: agentes gui en el dispositivo

El desarrollo de agentes autónomos capaces de interactuar con interfaces gráficas de usuario (GUI) es un problema complejo, especialmente cuando se busca que estos agentes sean pequeños y puedan funcionar directamente en dispositivos (on-device), sin depender de una conexión constante a la nube. App

Libro explica RLHF: guía para IA con retroalimentación humana

Nathan Lambert ha publicado un libro introductorio sobre RLHF (Reinforcement Learning from Human Feedback), una técnica crucial para el desarrollo y despliegue de sistemas de aprendizaje automático, especialmente modelos de lenguaje. El libro está dirigido a personas con conocimientos cuantitativos

RLHF: Guía para el Aprendizaje con Retroalimentación Humana

Este documento presenta un libro introductorio sobre el aprendizaje por refuerzo con retroalimentación humana (RLHF), una técnica crucial para el despliegue de sistemas de aprendizaje automático de última generación. El libro explora los orígenes de RLHF, desde la literatura reciente hasta la conver