Skip to main content

DUSt3R Family Overview

DUSt3R を起点とする一連の model は、「複数の uncalibrated image から、camera pose、matching、dense 3D を一度に出す」ことを目指す geometry foundation model family です。VGGT と並んで、近年の CVPR / ECCV / ICCV で頻出のトピックです。

何が新しいのか​

古典的な 3D Reconstruction では、

のように、calibration → matching → SfM → MVS を順番に解いていました。各段階で失敗するとその後に伝播します。

DUSt3R family は、image pair を直接 transformer に入れ、両 view における dense 3D point map を出力します。Calibration がなくても動作する点が大きな特徴です。

系譜​

Model一言で
DUSt3RImage pair → 共通座標系の dense 3D point map
MASt3RDUSt3R + dense matching、metric-aware
MASt3R-SfMMASt3R を起点とした multi-view SfM
MoGeMonocular geometry estimation foundation model
VGGTMulti-view を transformer で一括処理

詳細ページ​

ページ内容
DUSt3RPair-wise dense 3D の foundation
MASt3RDUSt3R を dense matching と metric へ拡張
MoGeMonocular 3D geometry の foundation 化
DUSt3R / MASt3R in PipelinesSfM / NeRF / 3DGS との接続

数式で見る古典 pipeline と learned pointmap の対比​

古典的な reconstruction pipeline は、observation {Ii}\{I_i\} から calibration、matching、pose、depth を順に解きます。

{Ii}→{Ki}→{(u,u′)}→{(Ri,ti)}→{Di}\{I_i\}\to \{\mathbf{K}_i\}\to \{(\mathbf{u},\mathbf{u}')\}\to \{(\mathbf{R}_i,\mathbf{t}_i)\}\to \{D_i\}

それぞれの段階は局所的に最適化されますが、誤りが後段に伝播します。

DUSt3R 系は、これらの中間状態を pointmap という共通表現に圧縮して、一回の forward pass で予測します。

{Pi→r}=Fθ({Ii})\{\mathbf{P}_{i\to r}\}=F_\theta(\{I_i\})

ここで、Pi→r\mathbf{P}_{i\to r} は view ii の pixel に対応する 3D 点を共通 reference frame rr で表した pointmap です。Camera pose、depth、correspondence は、すべて pointmap からの線形・非線形写像として復元されます。

この式の気持ちは、「pipeline を切り分けて誤差を局所最適化する代わりに、共通表現を学習で直接出し、後段の幾何処理は確定的な写像として扱う」というものです。Calibration が不要な点と、weak texture / wide baseline でも初期化が壊れにくい点が利点として現れます。

関連ページ​

主なソース​