LingBot-Map: modelo fundacional 3D para reconstruir escenas en tiempo real

Fuentes: LingBot-Map: a feed-forward 3D foundation model for streaming scene reconstruction

LingBot-Map es un modelo fundacional 3D feed-forward, publicado en GitHub por el equipo Robbyant, diseñado para reconstruir escenas tridimensionales a partir de secuencias de vídeo en streaming. Su arquitectura se articula en torno al Geometric Context Transformer, un componente que unifica el anclaje de coordenadas, las señales geométricas densas y la corrección de drift de largo alcance en un único flujo de procesamiento mediante anclas de contexto, ventanas de referencia de pose y memoria de trayectoria.

El sistema ofrece inferencia en streaming de alta eficiencia gracias a una arquitectura feed-forward con atención de caché KV paginada, capaz de mantener aproximadamente 20 FPS a una resolución de 518×378 en secuencias que superan los 10.000 fotogramas. En pruebas comparativas sobre conjuntos de datos como KITTI, Oxford Spires, VBR, Droid-W, TUM-D, 7-scenes, ETH3D, Tanks and Temples y NRGBD, el modelo supera tanto a métodos de streaming como a enfoques basados en optimización iterativa.

La instalación se realiza mediante un entorno conda con Python 3.10 y PyTorch 2.8.0 sobre CUDA 12.8, incluyendo opcionalmente FlashInfer para acelerar la atención. Se distribuye en tres variantes de pesos en Hugging Face y ModelScope —lingbot-map-long, para secuencias largas y escenas a gran escala; lingbot-map, equilibrado y empleado en el paper y los benchmarks; y lingbot-map-stage1, pensado para entrenamiento intermedio. Un visor web basado en viser permite explorar los resultados, y el repositorio ofrece demos para interiores, exteriores, escenas aéreas y ejemplos de gran longitud, como un recorrido interior de 25.000 fotogramas. Entre las novedades recientes figuran la publicación de benchmarks de evaluación, la corrección de errores en la caché KV y la aceleración del modelo.