UniEvo-VL es un marco de auto-evolución diseñado para mejorar el rendimiento de los modelos multimodales modernos mediante la auto-distilación durante la inferencia. A diferencia de los enfoques tradicionales que dependen de un modelo maestro externo, este sistema aprovecha las críticas internas del propio modelo como información privilegiada. El mecanismo opera en tiempo de prueba, donde un único modelo multimodal actúa simultáneamente como maestro y estudiante, pero con contextos distintos: el estudiante recibe la pregunta original, mientras que el maestro condicionalmente utiliza la crítica de autoevaluación. El entrenamiento minimiza la divergencia entre las distribuciones de difusión de denoising de ambos estados a lo largo de las trayectorias de muestreo del estudiante.
Los experimentos demuestran que UniEvo-VL mejora significativamente las capacidades de generación de imágenes, manteniendo la sensibilidad a la información de reflexión adicional. Basándose en el modelo de código abierto Qwen-image-2512, el sistema logra una mejora del 0.747 a 0.808 en la métrica GenEval y de 32.97 a 35.53 en GenEval2 Soft-TIFA. Además, pruebas con críticos externos más potentes, como GPT5.6-Luna, indican que los modelos multimodales con fuertes capacidades de juicio pueden anticipar un techo de auto-evolución más alto. Sin embargo, los resultados de renderizado de texto sugieren que estas mejoras no son uniformes en todas las tareas. El estudio contribuye a la línea de investigación de la mejora recursiva de la IA, buscando optimizar la experiencia de usuario en modelos multimodales sin supervisión externa.
