MoGe-3は清華大学、中国科学技術大学、Microsoft Researchの研究者が開発した幾何推定モデルです。写真から実スケールの深度、点マップ、法線、カメラ幾何を推定し、深度を使う編集やシーン復元に活用できます。
細い構造を3D空間で精細化する理由
画像で隣り合う画素が、3Dでは離れた表面に属する場合があります。特徴を混ぜると手すり、植物、小物の形状が平滑化されます。
Self-Guided Sparse Refinementは初期点マップをボクセルシェルに変換。疎な3D畳み込みで空間的な近傍を使い、反復でより細い構造を回復します。
写真から出力できるもの
MoGeのツールは点マップ、深度、法線、カメラ視野角を扱います。推論CLIはマップとGLB・PLYの幾何を保存できます。
GLBは画像の色をテクスチャとして保存し、3Dビューアーでの確認に向いています。PLYは頂点に色を保存し、幾何や点群の処理に適しています。使用するエディターや処理手順に合わせて選択してください。
チェックポイントを指定してMoGe-3を実行
Python 3.10以降でリポジトリの依存関係をインストールします。--version v3でモデルを選び、--pretrained PATH_TO_CKPT.ptでMoGe-3のチェックポイントを指定してください。
以下のコマンドは3回の精細化でマップと幾何を出力します。反復回数と入力解像度は別の設定です。細い構造と境界を比較してから回数を増やしてください。
moge infer -i photo.jpg \
--version v3 \
--pretrained PATH_TO_CKPT.pt \
--refine_steps 3 \
--output output \
--maps --glb --ply シーン幾何と完全なアセットの使い分け
写真の見える表面配置が必要ならMoGe-3を選びます。深度を使う合成、部屋表面の初期復元、幾何確認などに向いています。
全方向から見られる商品、小物、キャラクターが必要なら画像から3D生成を使います。どちらも3Dファイルを出力できますが、解決する目的は異なります。
MoGe-3と3Dアセット生成
| 目的 | MoGe-3 | アセット生成 |
|---|---|---|
| 主目的 | 見えるシーン幾何の復元 | 完全で再利用可能な物体 |
| 入力 | シーンや物体の写真 | 鮮明な被写体参考画像 |
| 隠れた表面 | 不可視部分の測定ではない | 生成モデルが補完 |
| 出力 | 深度・点マップ、GLB、PLY | 物体メッシュと材質 |
よくある質問
MoGe-3はTRELLIS 3ですか?
別のプロジェクトです。TRELLISはアセットを生成し、MoGeは画像の可視情報から幾何を推定します。
MoGe-3にはどのチェックポイントがありますか?
公式モデルには3億7,000万パラメーターのViT-Lと12億5,000万のViT-Gがあります。どちらも実スケールの幾何と法線マップに対応しています。選んだチェックポイントをダウンロードし、--version v3とともに--pretrainedで指定してください。
公式コードはmacOSで動きますか?
現在は非対応です。FlexGEMMが依存するTritonにmacOSパッケージがありません。対応環境か公式デモを利用してください。
オンラインデモやComfyUI対応はありますか?
Ruicheng/MoGe-3のHugging Faceデモがあります。2026年9月21日のComfyUI v0.37.0でもMoGe 3が追加されました。