Por qué los grandes modelos de lenguaje fallan en predicción tabular

Fuentes: Why Large Language Models Fail at Tabular Prediction

Un estudio reciente publicado en arXiv investiga por qué los grandes modelos de lenguaje (LLMs), tan versátiles en tareas de lenguaje, siguen rindiendo muy por debajo de métodos clásicos de machine learning cuando se aplican a predicción sobre datos tabulares — el tipo de problema más habitual en analítica predictiva.

El trabajo pone a prueba a un LLM de frontera en su modo de inferencia más puro: una única pasada de generación sobre un prompt que contiene los datos de entrenamiento y de prueba, sin herramientas, sin agentes y sin ajuste fino. A través de experimentos controlados sobre 31 conjuntos de datos de referencia, los autores descartan cinco hipótesis habituales sobre el fallo: que el modelo no gestione datos ruidosos o no linealmente separables, que el formato CSV linealizado oculte la estructura de columnas, que la tokenización de los valores numéricos degrade el rendimiento, o que el número de puntos de prueba clasificados por consulta sea el problema.

La dimensión de los datos, en cambio, sí resulta decisiva. Al proyectar aleatoriamente los datos a espacios de menor dimensión y comparar el LLM con ocho métodos clásicos, el modelo de lenguaje es el único cuya precisión cae al crecer la dimensionalidad, mientras que todas las baselines clásicas se mantienen estables o mejoran. Un análisis conductual frente a 252 modelos clásicos ajustados muestra que en dos dimensiones el LLM se comporta como un método local basado en distancias (con un 91,6% de coincidencia en cuadrícula), pero en dimensiones más altas ningún modelo clásico —ni siquiera añadiendo ruido calibrado dependiente de la dimensión— reproduce sus predicciones.

Los autores no identifican el mecanismo interno exacto, pero concluyen que la capacidad del LLM se disuelve con la dimensión de una forma que ningún aprendiz clásico con ruido imita, lo que explica por qué los LLMs, tan capaces en otros terrenos, pierden frente a baselines de hace cinco décadas cuando compiten sobre tablas.