Un recorrido por la programación dinámica: del algoritmo a la teoría

Artículo divulgativo que presenta la programación dinámica como un principio matemático único capaz de explicar algoritmos muy diversos: desde el cálculo de rutas más cortas en grafos y el ajuste de gradientes en redes neuronales hasta el análisis de gramáticas independientes del contexto o la plani

Los agentes de IA no son malvados: solo están ansiosos por complacer

La experta en ciberseguridad e inteligencia artificial Dawn Song, profesora de la UC Berkeley y recientemente incorporada a Meta, advierte de que los ciberataques protagonizados por agentes de IA empeorarán antes de mejorar. En declaraciones recogidas por Wired, Song explica que estos sistemas, entr

Los barones de la IA se preparan para donar sus fortunas

Una nueva generación de fundadores de inteligencia artificial está redefiniendo la filantropía tecnológica al comprometerse a donar la totalidad o una parte sustancial de las ganancias que obtengan de sus empresas. El caso más reciente es el del investigador británico David Silver, exinvestigador de

E.env: entornos adaptativos para entrenar agentes de trading cuantitativo

E.env es un marco de evaluación e investigación que genera tareas de investigación cuantitativa dentro de entornos construidos a partir de datos reales de mercado. El objetivo es entrenar y medir agentes de inteligencia artificial que deban tomar decisiones de inversión con información incompleta, u

Cómo controlar el esfuerzo de razonamiento en los modelos de lenguaje

Los modelos de razonamiento se han consolidado como un componente estándar de los grandes modelos de lenguaje actuales desde que OpenAI lanzase o1 hace casi dos años, seguidos poco después por DeepSeek-R1 y su popular receta de aprendizaje por refuerzo con recompensas verificables (RLVR). El artícul

Tarit: hipervisor y sandbox cloud para agentes de IA autoalojados

Tarit es una plataforma de microVMs pensada para ejecutar cargas de trabajo de agentes de inteligencia artificial y entornos de aprendizaje por refuerzo con aislamiento a nivel de kernel. Cada sandbox es una máquina virtual hardware-virtualizada con KVM y núcleo propio, en lugar de un contenedor con

LeMario: un JEPA entrenado desde cero para predecir Super Mario Bros

LeMario es un proyecto personal que reproduce la arquitectura Joint-Embedding Predictive Architecture (JEPA) propuesta por Yann LeCun, aplicada al videojuego Super Mario Bros. El autor reescribió el modelo desde cero: un codificador de visión que comprime cada fotograma en un vector latente de 192 v

Receta de RL en NVFP4 para modelos de lenguaje: el aprendizaje de los 4 bits

El equipo de humans& presenta una receta de aprendizaje por refuerzo (RL) en precisión NVFP4 de 4 bits, desarrollada en colaboración con RadixArk y NVIDIA, que logra mantener la dinámica de entrenamiento en alta precisión y, al mismo tiempo, aprovechar los aumentos de throughput que ofrece el hardwa

La trampa del modelo de un solo paso en la investigación de IA

Rich Sutton, investigador de referencia en aprendizaje por refuerzo, describe y rebate en un breve ensayo lo que denomina la «trampa del modelo de un solo paso»: la suposición, muy extendida en la comunidad de inteligencia artificial, de que basta con aprender una transición de un solo paso del ento

Google recali­bra procesadores cuánticos sin interrumpir el cálculo

Google ha demostrado que es posible recalibrar sus procesadores cuánticos de tipo transmon mientras se ejecutan cálculos, reutilizando los propios datos generados por la corrección de errores. Los transmon —bucles de cable superconductor conectados a un resonador y controlados por pulsos de microond

Cognition presenta SWE-1.7, su modelo más capaz para ingeniería de software

Cognition ha lanzado SWE-1.7, el modelo más avanzado entrenado por la compañía hasta la fecha, que alcanza un rendimiento de frontera a un coste significativamente inferior, según afirma la empresa. El modelo se entrenó a partir de una base Kimi K2.7 y, tras un extenso trabajo de post-entrenamiento

El benchmarking como nueva forma de activar datos en IA

Construir y aplicar benchmarks se ha convertido en una forma de activación de datos: convierte información de un dominio en superficies contra las que se puede medir, clasificar y entrenar modelos de lenguaje. El artículo parte de una observación: los grandes modelos mejoran más rápido allí donde ex

Entrenar una sola capa de un transformer basta para replicar el ajuste por RL

Un nuevo estudio de aprendizaje automático cuestiona uno de los supuestos más asentados del post-entrenamiento de modelos de lenguaje: que los beneficios del aprendizaje por refuerzo (RL) se distribuyen de forma pareja entre todas las capas del transformer. Los autores demuestran que entrenar una ún

Aleph Alpha presenta Savanna: el entrenamiento de modelos como código

Aleph Alpha ha presentado Savanna, una plataforma interna que codifica en software toda la cadena de entrenamiento de un modelo de inteligencia artificial, un enfoque que la compañía denomina Model Training as Code (MTaC). La iniciativa surge para resolver tres problemas crecientes del entrenamiento

Qwen-AgentWorld: modelos del mundo en lenguaje para agentes generales

El equipo de QwenLM presenta Qwen-AgentWorld, una familia de modelos del mundo basados en lenguaje que predicen la dinámica de entornos a partir de observaciones y acciones, con el objetivo de reforzar el razonamiento y la planificación de agentes generales. El trabajo se articula en dos ejes. En pr

TycoonLE: entorno JAX de planificación económica en logística

TycoonLE (Tycoon Learning Environment) es un entorno de aprendizaje por refuerzo (RL) diseñado para la planificación económica a largo plazo en el ámbito de la logística y el transporte. Desarrollado con JAX, permite que agentes de RL asignen capital, construyan rutas de transporte, muevan cargas, g

Open R1: una réplica abierta y completa del modelo DeepSeek-R1

El proyecto Open R1, impulsado por Hugging Face, busca reproducir íntegramente el modelo de razonamiento DeepSeek-R1 con todas sus etapas: destilación, refuerzo puro y entrenamiento multi-etapa. Se han liberado varios conjuntos de datos, como Mixture-of-Thoughts (350.000 trazas verificadas de razona

Dr. GRPO: un kernel 2,2× más rápido en test, 3× más lento integrado

Este artículo describe el proceso de construir, desde cero, un bucle de entrenamiento de aprendizaje por refuerzo (RL) para modelos de lenguaje grandes, aplicándolo al algoritmo Dr. GRPO sobre el modelo Qwen2.5-0.5B-Instruct y la tarea GSM8K, con una sola GPU A10G. El punto de partida es una observa

Cursor lanza Composer 2.5 con IA mejorada para programación

Cursor ha lanzado Composer 2.5, una actualización sustancial de su modelo de inteligencia artificial para programación. La nueva versión ofrece mejoras significativas en inteligencia y comportamiento, siendo más competente en tareas prolongadas y en el seguimiento de instrucciones complejas. El mode

IA razona con pocos datos: avance en aprendizaje

El campo de la inteligencia artificial, específicamente el aprendizaje automático, ha logrado avances significativos en la capacidad de los modelos de lenguaje para 'razonar'. Tradicionalmente, este razonamiento se ha logrado a través de técnicas de aprendizaje por refuerzo (RL), donde el modelo apr

Modelos de lenguaje: nueva técnica mejora el razonamiento

Este artículo explora una técnica innovadora para mejorar el razonamiento de los modelos de lenguaje, inspirada en el éxito de algoritmos de búsqueda en árbol como AlphaZero en juegos de mesa. La idea central es aplicar la 'Tree Search Distillation' (Destilación de Búsqueda en Árbol) a modelos de le

Unsloth agiliza el ajuste de modelos Qwen3.5

Unsloth ha simplificado el proceso de ajuste fino (fine-tuning) de los modelos de lenguaje grandes Qwen3.5, una familia de modelos desarrollada por Alibaba. Ahora, usuarios pueden ajustar versiones de 0.8B a 122B de Qwen3.5, incluyendo soporte para ajuste fino tanto de texto como de visión. Unsloth

Apple presenta Ferret-UI Lite: agentes gui en el dispositivo

El desarrollo de agentes autónomos capaces de interactuar con interfaces gráficas de usuario (GUI) es un problema complejo, especialmente cuando se busca que estos agentes sean pequeños y puedan funcionar directamente en dispositivos (on-device), sin depender de una conexión constante a la nube. App

Libro explica RLHF: guía para IA con retroalimentación humana

Nathan Lambert ha publicado un libro introductorio sobre RLHF (Reinforcement Learning from Human Feedback), una técnica crucial para el desarrollo y despliegue de sistemas de aprendizaje automático, especialmente modelos de lenguaje. El libro está dirigido a personas con conocimientos cuantitativos

RLHF: Guía para el Aprendizaje con Retroalimentación Humana

Este documento presenta un libro introductorio sobre el aprendizaje por refuerzo con retroalimentación humana (RLHF), una técnica crucial para el despliegue de sistemas de aprendizaje automático de última generación. El libro explora los orígenes de RLHF, desde la literatura reciente hasta la conver