World Labs presenta Atlas, su modelo de mundo de última generación orientado a alcanzar la inteligencia espacial. La compañía, fundada con la misión de construir modelos de propósito general capaces de generar, reconstruir y simular cualquier mundo posible, describe a Atlas como un sistema multimodal entrenado desde cero para operar de forma nativa con texto, imágenes, vídeo y datos tridimensionales.
Según la información publicada en el sitio oficial de World Labs (www.worldlabs.ai), Atlas es un transformador autorregresivo de difusión que combina todas sus entradas en un contexto espacial compartido. A partir de dicho contexto, el modelo predice lo que viene a continuación manteniendo coherencia tridimensional con todo lo observado e imaginando lo que queda fuera del encuadre. La compañía subraya que Atlas fue diseñado para escalar: su rendimiento mejora a medida que aumenta el cómputo de entrenamiento, una tendencia que, según la propia empresa, debería mantenerse en futuras iteraciones.
El modelo puede abordar un abanico amplio de tareas agrupadas en cuatro bloques principales. El primero, la generación controlada por cámara, permite producir imágenes y vídeos a partir de una o varias imágenes de referencia con control de cámara de precisión píxel-perfecta, generando hasta un minuto de vídeo en resolución 1440p. Cada imagen se ancla en una posición tridimensional dentro del contexto espacial, lo que abre posibilidades creativas inéditas: el usuario puede situar dos imágenes no relacionadas en el espacio 3D y el modelo genera un mundo que interpola suavemente entre ellas, imaginando pasillos, umbrales y transiciones entre ambas referencias.
El segundo bloque, la reconstrucción espacial, aborda la síntesis de vistas nuevas a partir de pocas imágenes, un problema clásico de la visión por computador durante décadas. World Labs afirma que Atlas alcanza resultados de vanguardia en reconstrucción 3D, superando a modelos entrenados específicamente para esa tarea. Con tan solo dos o tres imágenes de entrada, Atlas suele ofrecer reconstrucciones fieles; con más de un centenar, puede recrear entornos reales completos. Los ejemplos difundidos incluyen desde la reconstrucción del Main Quad de Stanford a partir de entre dos y veinticinco imágenes a nivel del suelo, hasta la generación de trayectorias aéreas sobre el campus a partir de vistas terrestres.
Además de producir imágenes y vídeos bidimensionales, Atlas opera de forma nativa sobre mapas de profundidad, lo que le permite generar mundos como nubes de puntos o Gaussian Splats en 3D, representaciones muy útiles en robótica, videojuegos, diseño y efectos visuales. De hecho, este formato es el mismo que emplea Marble, el producto estrella de World Labs, lo que facilitará la integración del nuevo modelo en versiones futuras de la plataforma.
El tercer bloque, la simulación espacio-temporal, dota a Atlas de la capacidad de modelar cómo evoluciona el mundo a lo largo del tiempo. A partir de vídeos de entrada, el sistema puede reencuadrar las escenas para conseguir efectos visuales espectaculares y habilitar flujos de trabajo Real-to-Sim para robótica, una disciplina que necesita entornos simulados fieles para entrenar y validar algoritmos antes de llevarlos al mundo físico.
El cuarto y último bloque corresponde a la generación de imágenes a partir de texto, incluyendo panorámicas de 360 grados, con capacidad para seguir instrucciones complejas, renderizar texto y abarcar una amplia variedad de estilos visuales.
Aunque el anuncio se apoya casi por completo en la comunicación oficial de World Labs y no se han presentado, por el momento, comparativas independientes frente a otros modelos del sector, la apuesta técnica es ambiciosa. Atlas se sitúa en la intersección entre los modelos generativos tipo difusión y los grandes modelos multimodales tipo LLM, pero lleva la idea de "contexto" al terreno del espacio tridimensional. Si las afirmaciones de la compañía se confirman en pruebas externas, Atlas podría convertirse en una pieza clave para aplicaciones que hoy dependen de flujos costosos: producción audiovisual, gemelos digitales, videojuegos, diseño industrial y entrenamiento de robots.
Por ahora, World Labs no ha detallado fechas concretas de disponibilidad general ni precios, y se limita a anticipar que Atlas dará soporte a próximas versiones de Marble y a otros productos de la compañía. La pregunta que queda abierta es si la tendencia de mejora con el escalado se mantiene como prometen y hasta dónde puede llegar un modelo que, en esencia, pretende convertir cualquier prompt, imagen o vídeo en un mundo navegable.
