Noticias que mencionan RLHF

Libro explica RLHF: guía para IA con retroalimentación humana

Nathan Lambert ha publicado un libro introductorio sobre RLHF (Reinforcement Learning from Human Feedback), una técnica crucial para el desarrollo y despliegue de sistemas de aprendizaje automático, especialmente modelos de lenguaje. El libro está dirigido a personas con conocimientos cuantitativos

Apple supera a GPT-5 con IA de diseño impulsada por expertos

Apple ha logrado un avance significativo en el desarrollo de inteligencia artificial para diseño de interfaces de usuario (UI), según documentos internos filtrados. La compañía ha superado al modelo GPT-5 de OpenAI al afinar el modelo Qwen3-Coder, un modelo de menor tamaño, mediante un nuevo enfoque

IA pierde originalidad: surge el término 'abolición semántica'

Un nuevo término, 'abolición semántica', ha surgido para describir un problema crítico en la escritura generada por IA: la pérdida de originalidad y profundidad. Según un artículo de The Register, este fenómeno ocurre porque los modelos de lenguaje, al buscar optimizar la probabilidad estadística y

IA y AuDHD: Una Frustrante Comunicación

Este artículo explora una experiencia frustrante con un agente de IA y cómo esta revela un patrón de comunicación más amplio que el autor ha experimentado a lo largo de su vida. El autor, diagnosticado con TDAH y autismo (AuDHD), se encontró luchando contra un agente de IA que ignoraba las reglas ex

IA: ¿Apariencia de trabajo o valor real?

El artículo "Simulacro del Trabajo de Conocimiento" plantea un problema crucial en la era de la inteligencia artificial generativa: la creación de una apariencia de trabajo de calidad sin la sustancia real. El concepto central es el de los 'proxy measures' o medidas sustitutas. En el ámbito profesio

El problema invisible que hace fallar las evaluaciones de IA

Este artículo aborda uno de los problemas más críticos y poco reconocidos en el desarrollo de modelos de lenguaje grandes (LLMs): nuestra incapacidad para anticipar cuándo y cómo evolucionarán las capacidades de estos sistemas. Los autores argumentan que las evaluaciones existentes son reactivas: so

Escribir para personas, no para máquinas

La proliferación de textos técnicos generados automáticamente por modelos de lenguaje está dificultando la lectura humana del software. La ingeniera Vicki Boykis sostiene que descripciones de pull requests, notas de mantenimiento y documentación se han vuelto cada vez más largas y cargadas de jerga,

Investigadores de IA debaten la cercanía de la auto-mejora recursiva

John Schulman, Beren Millidge y Charlie O’Neill analizan en un nuevo episodio del Dwarkesh Podcast los obstáculos técnicos que podrían impedir la llegada de una superinteligencia generalizada en 2036. Los expertos, vinculados a Thinking Machines, Zyphra y Baseten respectivamente, argumentan que la p