Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
Paper

Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation

Anton Obukhov
2026.09.09
·Arxiv·by Homin.Lee
#Computer Vision#Deep Learning#Diffusion Transformers#Image Editing#Monocular Depth Estimation

핵심 포인트

  • 1Marigold V2는 Qwen-Image-Edit 기반의 Diffusion Transformer를 활용하여 단일 GPU에서도 1주일 이내에 학습 가능한 비용 효율적인 monocular depth estimation 프레임워크를 제안합니다.
  • 2Ground-truth depth map에서 추출한 특징을 활용하는 iREPA-depth 정규화 기법을 통해 구조적 정밀도를 개선하고, 2단계 학습 과정에서 도입된 SinkLoss로 미세한 세부 묘사와 경계선 품질을 극대화했습니다.
  • 3해당 모델은 KITTI 및 ETH3D와 같은 표준 벤치마크에서 AbsRel 지표를 16~26% 향상시키며 SOTA 수준의 성능을 달성하였고, surface normal estimation 및 depth completion 등 다양한 dense regression 작업에도 효과적으로 적용됩니다.

본 논문은 최신 이미지 편집용 Diffusion Transformer (DiT)Qwen-Image-Edit를 단일 이미지 깊이 추정 모델로 재구성하는 효율적인 학습 프로토콜인 Marigold V2를 제안합니다. 이 연구는 기존의 diffusion 기반 깊이 추정 모델들이 겪던 세밀한 디테일 손실 및 경계면의 평활화(oversmoothing) 문제를 해결하는 데 중점을 둡니다.

핵심 방법론:

  1. 2단계 파인튜닝 프로토콜 (2-stage Fine-tuning Protocol):
    • Stage 1: QLoRA를 사용하여 사전 학습된 DiT 가중치를 4-bit로 양자화하고 효율적으로 학습합니다. 이때 정규화된 로그 깊이 타겟 dd를 활용하여 척도 불변(affine-invariant) 깊이를 예측합니다.
    • Stage 2: SinkLoss를 도입하여 경계면의 날카로움을 개선하고 세밀한 구조를 보존합니다.
  1. iREPA-depth (Internal Representation Alignment):
    • 기존의 RGB 기반 정규화 대신, Ground-truth 깊이 맵에서 추출한 DINOv3 특징(feature)을 정규화 타겟으로 사용합니다. 이는 모델이 기하학적 구조를 더 명확하게 학습하도록 유도하여 수렴 속도와 시각적 품질을 동시에 향상합니다.
  1. SinkLoss:
    • 픽셀 단위의 엄격한 손실 함수가 가진 한계를 극복하기 위해 제안된 새로운 손실 함수입니다. 이미지 내 K×KK \times K 블록 단위로 예측 깊이와 실제 깊이 사이의 Optimal Transport 문제를 해결하며, Sinkhorn-Knopp 알고리즘을 통해 계산됩니다.
    • 공식: M=argminMUM,C~τH(M)M = \arg \min_{M \in U} \langle M, \tilde{C} \rangle - \tau H(M), 여기서 C~\tilde{C}는 예측값과 실제값 사이의 비용 행렬입니다. 이는 노이즈가 섞인 학습 데이터에서도 털, 머리카락, 투명한 물체 등 미세한 디테일을 효과적으로 복원하게 합니다.
  1. 추론 과정:
    • 정제된 단일 단계(single-step) 추론 방식을 통해 VAE 디코더와 DiT를 한 번만 통과하여 깊이 맵을 생성합니다.
    • 공식: z^d=zIfθ(zI,t)\hat{z}_d = z_I - f_\theta(z_I, t) (t=0.5t=0.5로 고정)

성과: Marigold V2는 단일 consumer GPU 환경에서 일주일 이내에 학습 가능할 만큼 비용 효율적이며, KITTIETH3D 벤치마크에서 이전 모델 대비 AbsRel 기준 16-26% 이상의 성능 향상을 보였습니다. 특히 털이나 머리카락과 같은 정교한 구조를 유지하는 능력에서 기존의 Pixel-Perfect Depth (PPD)InfiniDepth를 상회하며, 깊이 추정뿐만 아니라 표면 법선(surface normals) 추정 및 내재적 이미지 분해(intrinsic image decomposition) 등 다양한 고밀도 회귀(dense regression) 작업으로 범용적 확장이 가능함을 입증했습니다.