LensVLM es un marco de inferencia y una receta de post-entrenamiento diseñado para resolver la degradación de precisión que sufren los Modelos de Lenguaje Visuales (VLM) cuando procesan texto representado como imágenes comprimidas. A diferencia de los enfoques basados en la recuperación que dependen de la búsqueda de texto, LensVLM escanea las imágenes comprimidas y expande selectivamente solo las partes relevantes hasta su forma no comprimida mediante herramientas aprendidas. Este enfoque permite mantener una alta precisión incluso en ratios de compresión muy altos, donde los caracteres se vuelven indistinguibles para los codificadores visuales estándar.
El sistema se construye sobre la base de Qwen3.5-9B-Base y demuestra una robustez superior a las líneas base de compresión visual y textual. En siete benchmarks de preguntas y respuestas sobre texto, LensVLM iguala la precisión del límite superior de texto completo a un ratio de compresión efectiva de 4.3x, superando a las líneas base de recuperación hasta un ratio de 10.1x. Además, el modelo generaliza eficazmente a tareas de comprensión de documentos multimodales y código, donde la ganancia de precisión sobre las líneas base aumenta a medida que la compresión se intensifica. El análisis técnico valida que el entrenamiento hace a la compresión visual robusto frente a las elecciones de renderizado, y que el modelo depende cada vez más del contenido expandido que de la lectura visual directa a medida que la compresión aumenta. Esta distinción guía la elección de herramientas: la expansión de texto es preferible para texto renderizado, mientras que la expansión de imágenes de alta resolución es más adecuada para documentos nativos donde las pistas de diseño son relevantes para la tarea.
