DUSt3R Family Overview
DUSt3R を起点とする一連の model は、「複数の uncalibrated image から、camera pose、matching、dense 3D を一度に出す」ことを目指す geometry foundation model family です。VGGT と並んで、近年の CVPR / ECCV / ICCV で頻出のトピックです。
何が新しいのか
古典的な 3D Reconstruction では、
のように、calibration → matching → SfM → MVS を順番に解いていました。各段階で失敗するとその後に伝播します。
DUSt3R family は、image pair を直接 transformer に入れ、両 view における dense 3D point map を出力します。Calibration がなくても動作する点が大きな特徴です。
系譜
| Model | 一言で |
|---|---|
| DUSt3R | Image pair → 共通座標系の dense 3D point map |
| MASt3R | DUSt3R + dense matching、metric-aware |
| MASt3R-SfM | MASt3R を起点とした multi-view SfM |
| MoGe | Monocular geometry estimation foundation model |
| VGGT | Multi-view を transformer で一括処理 |
詳細ページ
| ページ | 内容 |
|---|---|
| DUSt3R | Pair-wise dense 3D の foundation |
| MASt3R | DUSt3R を dense matching と metric へ拡張 |
| MoGe | Monocular 3D geometry の foundation 化 |
| DUSt3R / MASt3R in Pipelines | SfM / NeRF / 3DGS との接続 |
数式で見る古典 pipeline と learned pointmap の対比
古典的な reconstruction pipeline は、observation から calibration、matching、pose、depth を順に解きます。
それぞれの段階は局所的に最適化されますが、誤りが後段に伝播します。
DUSt3R 系は、これらの中間状態を pointmap という共通表現に圧縮して、一回の forward pass で予測します。
ここで、 は view の pixel に対応する 3D 点を共通 reference frame で表した pointmap です。Camera pose、depth、correspondence は、すべて pointmap からの線形・非線形写像として復元されます。
この式の気持ちは、「pipeline を切り分けて誤差を局所最適化する代わりに、共通表現を学習で直接出し、後段の幾何処理は確定的な写像として扱う」というものです。Calibration が不要な点と、weak texture / wide baseline でも初期化が壊れにくい点が利点として現れます。
関連ページ
主なソース
- DUSt3R paper: https://arxiv.org/abs/2312.14132
- MASt3R paper: https://arxiv.org/abs/2406.09756
- MoGe paper: https://arxiv.org/abs/2410.19115
- naver/dust3r GitHub: https://github.com/naver/dust3r
- naver/mast3r GitHub: https://github.com/naver/mast3r