Feyn, un equipo de investigación en inteligencia artificial, ha presentado MultiMatte, un modelo de segmentación y mateado (separación de sujeto y fondo con transparencia) que permite indicar con una frase qué objeto conservar en una imagen y elimina el resto. Está construido sobre SAM 3, el detector de Meta de 2025, y se entrena con adaptación de bajo rango (LoRA) sobre el 2,27 % de los pesos, lo que preserva la alineación texto-visión del modelo original y añade una cabeza de mateado capaz de representar contornos difusos como cabellos o pantallas desenfocadas.
La principal diferencia frente a SAM 3 es que MultiMatte no devuelve máscaras binarias, sino alphas continuas que describen la opacidad de cada píxel, lo que mejora los bordes suaves. En el benchmark DIS-VD, alcanza una S-measure de 0,901 frente al 0,667 de SAM 3; en otras divisiones del conjunto DIS, las puntuaciones oscilan entre 0,893 y 0,923, y en DAVIS-S llega a 0,979, con mejoras también en HRSOD, UHRSD, DUTS, DUT-OMRON, COD10K y CAMO. El ajuste se realizó con 19.953 imágenes a lo largo de 14.000 pasos, usando focal loss y Dice loss, y el 24,8 % del conjunto incorporó etiquetas escritas por personas para enseñar el vínculo con el texto.
MultiMatte se distribuye como parte de la biblioteca NoBg de Feyn (instalable con pip install nobg) y permite obtener un cutout RGBA pasando una descripción como 'the dog'. La demostración está disponible en usefeyn.com/multimatte.
