NEvo: vídeos evolutivos guiados por redes neuronales para mapear la selectividad visual del cerebro

Fuentes: NEvo: Neural-Guided Evolutionary Video Synthesis for Dynamic Visual Selectivity

NEvo es un nuevo método computacional, desarrollado por investigadoras e investigadores de la Escuela Politécnica Federal de Lausana (EPFL) y de la Universidad Johns Hopkins, que emplea algoritmos evolutivos guiados por un modelo neuronal para sintetizar vídeos diseñados a medida que activan al máximo una región concreta del córtex visual. Su objetivo es entender qué tipo de contenido multimedia enciende cada área del cerebro y cómo evoluciona esa selectividad a lo largo de la vía visual.

El sistema funciona en dos etapas. Primero entrena un "gemelo digital" —un modelo de codificación— capaz de predecir la respuesta de cada región visual ante cualquier vídeo. A partir de ahí, NEvo describe cada vídeo mediante un conjunto de "genes" (sujeto, iluminación, movimiento, estado de ánimo) y los somete a un proceso evolutivo: genera lotes, los puntúa según la activación prevista, conserva los mejores y aplica cruce y mutación. Tras muchas generaciones, la activación predicha aumenta de forma sostenida. Para abaratar el coste, primero busca la imagen fija más activadora y después aplica una segunda búsqueda centrada en el movimiento para animarla en un clip de dos segundos.

Los vídeos resultantes reproducen lo que ya se sabía de cada región: caras en FFA, lugares en PPA, cuerpos en EBA, movimiento en MT, patrones en V1 y V3A, e interacciones sociales dinámicas en pSTS y aSTS. En todas las regiones probadas, los vídeos de NEvo generan mayor activación que los estímulos localizadores clásicos y que los mejores vídeos naturales; además, la versión en movimiento siempre supera a su primer fotograma congelado, lo que confirma que esas áreas prefieren estímulos dinámicos.

Cuando se desplaza una ventana de búsqueda desde V1 hacia aSTS, los estímulos sintetizados —y las nubes de palabras que los describen— transitan de patrones simples y movimiento hacia personas, caras e interacción social. Incluso partiendo de discos abstractos apilados, optimizar para pSTS produce escenas con personajes que interactúan, mientras que optimizar para MT genera movimiento puro, lo que aísla con precisión la característica preferida de cada región.