
Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
핵심 포인트
- 1Marigold V2는 Qwen-Image-Edit 기반의 Diffusion Transformer를 활용하여 단일 GPU에서도 1주일 이내에 학습 가능한 비용 효율적인 monocular depth estimation 프레임워크를 제안합니다.
- 2Ground-truth depth map에서 추출한 특징을 활용하는 iREPA-depth 정규화 기법을 통해 구조적 정밀도를 개선하고, 2단계 학습 과정에서 도입된 SinkLoss로 미세한 세부 묘사와 경계선 품질을 극대화했습니다.
- 3해당 모델은 KITTI 및 ETH3D와 같은 표준 벤치마크에서 AbsRel 지표를 16~26% 향상시키며 SOTA 수준의 성능을 달성하였고, surface normal estimation 및 depth completion 등 다양한 dense regression 작업에도 효과적으로 적용됩니다.
본 논문은 최신 이미지 편집용 Diffusion Transformer (DiT)인 Qwen-Image-Edit를 단일 이미지 깊이 추정 모델로 재구성하는 효율적인 학습 프로토콜인 Marigold V2를 제안합니다. 이 연구는 기존의 diffusion 기반 깊이 추정 모델들이 겪던 세밀한 디테일 손실 및 경계면의 평활화(oversmoothing) 문제를 해결하는 데 중점을 둡니다.
핵심 방법론:
- 2단계 파인튜닝 프로토콜 (2-stage Fine-tuning Protocol):
- Stage 1: QLoRA를 사용하여 사전 학습된 DiT 가중치를 4-bit로 양자화하고 효율적으로 학습합니다. 이때 정규화된 로그 깊이 타겟 를 활용하여 척도 불변(affine-invariant) 깊이를 예측합니다.
- Stage 2: SinkLoss를 도입하여 경계면의 날카로움을 개선하고 세밀한 구조를 보존합니다.
- iREPA-depth (Internal Representation Alignment):
- 기존의 RGB 기반 정규화 대신, Ground-truth 깊이 맵에서 추출한 DINOv3 특징(feature)을 정규화 타겟으로 사용합니다. 이는 모델이 기하학적 구조를 더 명확하게 학습하도록 유도하여 수렴 속도와 시각적 품질을 동시에 향상합니다.
- SinkLoss:
- 픽셀 단위의 엄격한 손실 함수가 가진 한계를 극복하기 위해 제안된 새로운 손실 함수입니다. 이미지 내 블록 단위로 예측 깊이와 실제 깊이 사이의 Optimal Transport 문제를 해결하며, Sinkhorn-Knopp 알고리즘을 통해 계산됩니다.
- 공식: , 여기서 는 예측값과 실제값 사이의 비용 행렬입니다. 이는 노이즈가 섞인 학습 데이터에서도 털, 머리카락, 투명한 물체 등 미세한 디테일을 효과적으로 복원하게 합니다.
- 추론 과정:
- 정제된 단일 단계(single-step) 추론 방식을 통해 VAE 디코더와 DiT를 한 번만 통과하여 깊이 맵을 생성합니다.
- 공식: (로 고정)
성과: Marigold V2는 단일 consumer GPU 환경에서 일주일 이내에 학습 가능할 만큼 비용 효율적이며, KITTI 및 ETH3D 벤치마크에서 이전 모델 대비 AbsRel 기준 16-26% 이상의 성능 향상을 보였습니다. 특히 털이나 머리카락과 같은 정교한 구조를 유지하는 능력에서 기존의 Pixel-Perfect Depth (PPD) 나 InfiniDepth를 상회하며, 깊이 추정뿐만 아니라 표면 법선(surface normals) 추정 및 내재적 이미지 분해(intrinsic image decomposition) 등 다양한 고밀도 회귀(dense regression) 작업으로 범용적 확장이 가능함을 입증했습니다.