EvoVLM: Búsqueda evolutiva guiada por LLM para inferencia visual

Fuentes: EvoVLM: LLM-guided evolutionary search for efficient vision-language inference

EvoVLM es un proyecto de investigación que implementa una búsqueda evolutiva multiobjetivo guiada por modelos de lenguaje grandes (LLM) para mejorar la inferencia de visión y lenguaje. A diferencia de los enfoques tradicionales que requieren el ajuste fino de pesos de modelos, EvoVLM mantiene el modelo congelado y optimiza únicamente la lógica de inferencia, los prompts, el preprocesamiento de imágenes y los presupuestos de generación. El objetivo es mejorar el equilibrio entre precisión y latencia en la comprensión de gráficos científicos.

El sistema opera mediante un algoritmo evolutivo restringido que utiliza mutaciones tipadas y una evaluación local con un modelo Qwen para seleccionar configuraciones. Los programas resultantes se exportan como código Python ejecutable y se verifican mediante evidencia de ejecución cerrada. Los resultados preliminares, obtenidos en el conjunto de validación Dev128 y utilizando el protocolo de latencia Speed32, muestran mejoras significativas. Por ejemplo, la versión 'Evolved Instruct' conserva la precisión de la línea base manual pero reduce la latencia media en un 8,9%, mientras que 'Evolved Thinking' mejora la precisión en 16,41 puntos porcentuales con una reducción de latencia del 10,6%.

El repositorio incluye el código fuente, datos de prueba y la evidencia de verificación, aunque no distribuye los pesos de los modelos ni el conjunto de datos completo de CharXiv. La implementación se centra en la reproducibilidad y la transparencia, documentando el entorno de ejecución y los límites de la búsqueda, que se limita a dos generaciones con un tamaño de población controlado. Este enfoque permite explorar la eficiencia de la inferencia sin comprometer la integridad de los modelos de base.