Roboflow sometió a los nuevos modelos GPT-5.6 Sol, Terra y Luna de OpenAI, presentados la semana pasada, a su próximo benchmark de modelos de visión (VLM), que cubrirá detección de objetos, conteo, OCR y extracción de datos. Sol registró 46,2 mAP@50 en detección, frente a los 13,8 puntos de GPT-5.5, y un 73,0 % en conteo, frente al 64,9 % previo, situándose como el modelo de visión más potente publicado por OpenAI hasta la fecha. Terra (44,7 mAP@50) y Luna (43,3) también mejoran sustancialmente a su antecesor, aunque no alcanzan a Sol.
El estudio señala como fortaleza clave la detección de la estructura de documentos (títulos, párrafos, tablas, imágenes y firmas) y un buen desempeño en escenas densas, aunque Sol mostró inestabilidad en imágenes de 2.000 x 2.000 píxeles o mayores con bajo esfuerzo de razonamiento. En OCR, Sol apenas varió respecto a GPT-5.5 (90,7 % frente a 91,2 %) y retrocedió en extracción de texto (82,5 % frente a 87,6 %).
Las mejoras implican costes y latencias elevadas: Sol promedia unos 10 segundos por imagen y alrededor de 2,5 centavos por imagen, mientras Luna, la opción más económica, ronda los 5 segundos y menos de 0,5 centavos. Roboflow concluye que Gemini 3.5 Flash sigue siendo la opción más práctica para detección y conteo a gran escala por precio y rendimiento, aunque GPT-5.6 acerca a OpenAI a los principales VLM del mercado.
