Epoch AI ha reportado una mejora drástica en su nuevo benchmark, el Furniture Assembly Benchmark (FAB), que evalúa la capacidad de los modelos de inteligencia artificial para detectar errores en el montaje de muebles. En noviembre de 2025, el mejor modelo, Claude 4, alcanzaba un 28% de aciertos, mientras que en septiembre de 2026, GPT-6 de OpenAI logró un 80% de precisión. Esta evolución se debe a que los modelos no solo analizan la imagen, sino que integran el manual de instrucciones de IKEA, herramientas de ampliación y un intérprete de Python para reconstruir la secuencia de montaje y localizar fallos como piezas colocadas al revés.
El experimento, diseñado para medir el razonamiento abstracto y la conexión entre instrucciones y objetos reales, revela sesgos significativos según la familia de modelos: Gemini y Qwen tienden a falsos positivos, asumiendo errores inexistentes, mientras que modelos anteriores de OpenAI y Anthropic cometían falsos negativos. Aunque la prueba demuestra un avance en la verificación visual, no implica que las IAs puedan ejecutar físicamente el montaje desde cero. El estudio resalta la paradoja de Moravec, donde la IA facilita la verificación de tareas complejas, pero aún no ha alcanzado la autonomía para ejecutarlas sin supervisión humana.
