VGGT in 3D Reconstruction Pipelines
VGGT は単体でも geometry を出力できますが、実用上は他の component と組み合わせることが多いです。ここでは、代表的な組み合わせをまとめます。
NeRF / 3D Gaussian Splatting の初期化
NeRF や 3D Gaussian Splatting は、accurate な camera pose を前提とします。通常は COLMAP などで pose を推定しますが、view が少ない場合や弱 texture の場合には失敗しがちです。
VGGT は、こうした難しい条件でも camera pose と depth を出してくれるため、初期化に向いています。
Depth prior を加えると、特に sparse view 設定で formation が安定しやすくなります。
SLAM との関係
SLAM は real-time な online system ですが、VGGT のような heavy な model は frame ごとに動かすには重いです。代わりに、
- 初期 frame で VGGT を一度走らせて map を初期化する
- Loop closure 後の global refinement で使う
- Keyframe をまとめて再推定する
といった 戦略的な使い方が現実的です。
Dense reconstruction の後処理
VGGT の point map は dense point cloud に近いですが、そのままでは triangle mesh ほど整った表現ではありません。実用 pipeline では、
のように、古典的な Point Clouds, Meshes, and TSDF 系の処理と組み合わせます。
Foundation model 同士の組み合わせ
近年は、複数の vision foundation model を組み合わせる pipeline が増えています。
- VGGT: camera と粗い geometry
- Depth Anything: dense depth prior
- Segment Anything: object mask
これらを統合することで、editable で robust な 3D scene を構築できます。
数式で見る VGGT 初期化 + BA refinement
VGGT を 3D reconstruction の初期化として使う場合、最終的な camera と 3D 点は古典的な BA で refine することが多いです。VGGT が出した を初期値として、次の objective を最小化します。
VGGT の出力には予測の信頼度 が付くため、その値を観測重みとして objective に組み込めます。
この式の気持ちは、「学習された prior は強いが完全ではないので、観測としての画像点と幾何的整合性で最後に明示的に最適化し、信頼度の高い対応に重みを置く」というものです。Hybrid 構成では、VGGT の汎用性と BA の精度の両方を活かせます。
関連ページ
主なソース
- VGGT paper: https://arxiv.org/abs/2503.11651
- 3D Gaussian Splatting paper: https://repo-sam.inria.fr/fungraph/3d-gaussian-splatting/