Blog
Atlas: A World Model for Spatial Intelligence
2026.09.02
·Web·by JunhaRyu#3D Reconstruction#Diffusion Transformer#Multimodal AI#Spatial Intelligence#World Model
핵심 포인트
- 1Atlas는 텍스트, 이미지, 비디오, 3D 데이터를 통합 처리하여 공간 지능을 구현하는 multimodal autoregressive diffusion transformer 기반의 omni world model입니다.
- 2이 모델은 정밀한 카메라 제어를 통한 비디오 생성, sparse한 입력 데이터로부터의 고품질 3D spatial reconstruction, 그리고 실감 나는 space-time simulation 기능을 제공합니다.
- 3학습 데이터와 컴퓨팅 자원을 확장함에 따라 성능이 향상되는 스케일링 법칙을 따르며, 기존의 특화된 모델들을 능가하는 범용적인 world modeling 능력을 입증했습니다.
이 논문은 World Labs에서 발표한 차세대 omni world model인 Atlas를 소개합니다. Atlas는 텍스트, 이미지, 비디오, 3D 데이터를 통합하여 공간 지능(spatial intelligence)을 구현하도록 설계된 multimodal autoregressive diffusion transformer 모델입니다.
1. 핵심 아키텍처 및 방법론
Atlas는 단순한 생성 모델을 넘어 3D 공간의 물리적 일관성을 유지하는 데 초점을 맞추며, 다음과 같은 기술적 토대를 갖추고 있습니다.- Multimodal Autoregressive Diffusion Transformer: 이 모델은 입력 데이터를 순차적으로 처리하는 autoregressive 방식과 고차원 데이터 생성을 위한 diffusion 모델의 장점을 결합했습니다. 특히, 입력을 3D 공간상에 위치시킨 spatial context를 생성함으로써 물리적 일관성을 유지합니다.
- Spatial Context: 모든 입력 이미지와 3D 데이터는 명시적인 카메라 포즈와 결합되어 3D 공간상에 grounded 됩니다. 이는 모델이 단순히 픽셀을 생성하는 것이 아니라, 3D 구조를 이해하고 새로운 시점에서 장면을 재구성할 수 있게 합니다.
- Rectified Flow 기반 Diffusion: 모델은 denoising 과정을 통해 고해상도 이미지와 비디오를 생성합니다. 이는 VAE(Variational Autoencoder) 설계, diffusion distillation, classifier-free guidance 등의 최신 기법을 활용하여 효율성과 품질의 균형을 맞춥니다.
- Transformer Backbone: LLM의 구조적 특징인 KV-caching, cache-aware routing 등을 차용하여 대규모 확장성(scaling)을 확보했습니다.
2. 주요 기능 및 성능
Atlas는 세 가지 주요 영역에서 독보적인 성능을 발휘합니다.- Camera-Controlled Generation: 텍스트 명령 대신 정확한 카메라 기하학(camera geometry)을 입력으로 사용하여 픽셀 단위의 정교한 제어가 가능합니다. 최대 1분 길이의 1440p 영상을 생성할 수 있으며, 입력 이미지 간의 공간적 보간을 통해 존재하지 않는 시점까지 상상해냅니다.
- Spatial Reconstruction: 희소한(sparse) 입력 이미지들로부터 3D 공간을 복원합니다. 이는 3D Gaussian splat 및 point cloud 형태의 명시적인 3D 출력을 지원하여, 로보틱스, 게임, VFX 분야에서 즉각적인 활용이 가능합니다.
- Space-Time Simulation: 입력 영상의 시간과 공간을 모델링하여 'bullet time' 효과와 같은 고도의 영상 재구성 및 로보틱스 Real-to-Sim 워크플로우를 제공합니다. 센서 데이터(RGB 및 depth)를 생성하여 로봇 학습을 위한 시뮬레이션 환경을 구축하는 데 탁월합니다.
3. 평가 및 확장성
Atlas는 특정 작업에 국한된 전문 모델이 아님에도 불구하고, 다음과 같은 지표에서 우위를 점합니다.- Camera-Controlled Generation: 기존 비디오 모델들과 비교하여 정교한 카메라 경로 추종 능력에서 압도적인 사용자 선호도를 보입니다.
- 3D Reconstruction: DTU, KITTI, ScanNet 등 주요 벤치마크에서 기존의 3D 재구성 전문 모델들보다 낮은 평균 절대 상대 오차(Mean absolute-relative pointmap error)를 기록하며 뛰어난 일반화 성능을 입증했습니다.
결론적으로, Atlas는 데이터의 양과 연산 자원(compute)이 증가함에 따라 성능이 개선되는 스케일링 법칙을 따르며, 미래의 가상 및 물리 세계 시뮬레이션을 위한 핵심 엔진으로서 공간 지능의 새로운 패러다임을 제시하고 있습니다.