Los modelos de IA se están volviendo más ignorantes a propósito

Fuentes: Models Are Getting Dumber on Purpose

Los modelos de lenguaje actuales intercambian conocimiento factual por capacidad de razonamiento, y lo hacen de forma deliberada. Modelos como GLM-5.2 (99,2% en AIME 2026 con unos 40.000 millones de parámetros activos por token) o DeepSeek V4-Flash (13.000 millones activos) obtienen puntuaciones razonamiento muy superiores a las de GPT-4, que en 2023 operaba con unos 280.000 millones de parámetros activos y apenas resolvía problemas AIME. Sin embargo, en SimpleQA —prueba de recuerdo factual sin herramientas— el mejor modelo, Gemini 2.5 Pro, solo acierta el 53%, y los modelos pequeños como Qwen3.5 4B y 9B presentan tasas de alucinación del 80-82%.

El artículo explica que los hechos ocupan espacio: la investigación "Physics of Language Models" estima unas dos bits de conocimiento factual por parámetro, lo que justifica históricamente el tamaño de los modelos frontera. El razonamiento, en cambio, se comprime mejor porque consiste en procedimientos reutilizables (descomponer problemas, verificar el trabajo, retroceder). El entrenamiento por destilación y refuerzo en tareas verificables transfiere esos procedimientos a modelos pequeños, como demuestra Phi-4 (14.000 millones de parámetros), fuerte en matemáticas y débil en trivia.

El conocimiento que sobrevive tiene forma de generalista: sabe un poco de casi todo y casi nada en profundidad. Los datos factuales se quedan obsoletos rápido (APIs, precios, cargos cambian), mientras que los procedimientos no caducan. Por eso, el artículo defiende externalizar los hechos a un "arnés" de herramientas externas —búsquedas, documentación, sistemas de archivos— y mantener solo el razonamiento en los pesos del modelo. Cuando un dato reside en un documento y no en los pesos, se puede localizar, corregir y escribir un test de regresión; cuando reside en los pesos, un error factual es invisible e incorregible sin reentrenar. El autor concluye que esta separación podría permitir tarjetas gráficas sin knowledge cutoff y modelos frontera locales en una GPU de consumo de 24 GB.