MoGe-3 是清华大学、中国科学技术大学与微软研究院研究者参与的几何估计模型。它从照片预测真实尺度深度、点图、法线和相机几何,可用于深度编辑与场景重建。
为什么细薄结构需要在 3D 空间中细化
图片中相邻的像素,可能属于 3D 空间里相距很远的表面。混合这些特征,容易把栏杆、植物和小物体周围的几何变得模糊。
MoGe-3 的自引导稀疏细化先把初始点图提升到稀疏体素壳。稀疏 3D 卷积按照空间邻接关系处理,而不只看图像平面的邻近像素,再通过迭代恢复更细的结构。
一张照片可以导出什么
MoGe 工具链支持点图、深度图、法线图以及相机视场角估计。推理命令可以同时保存这些图和 GLB、PLY 几何文件。
GLB 将图像颜色保存为纹理,方便在 3D 查看器中检查;PLY 将颜色保存在顶点上,适合几何与点云处理。根据后续编辑器或处理流程选择格式。
指定检查点运行 MoGe-3
使用 Python 3.10 或更新版本并安装仓库依赖。用 --version v3 选择模型版本,再通过 --pretrained PATH_TO_CKPT.pt 指定 MoGe-3 检查点。
下面的命令使用三次细化,同时导出图和几何。增加细化次数与提高输入分辨率不是同一件事;先比较输出中的细杆和边界,再决定是否增加次数。
moge infer -i photo.jpg \
--version v3 \
--pretrained PATH_TO_CKPT.pt \
--refine_steps 3 \
--output output \
--maps --glb --ply 选择场景几何恢复,还是完整资产生成
如果需要的是照片中可见表面的空间关系,可以使用 MoGe-3,例如深度感知合成、房间表面的初始重建和几何检查。
如果需要能从各个方向旋转、复用的商品、道具或角色,则应使用图片转 3D 生成。两者都能输出 3D 文件,但解决的问题不同。
MoGe-3 与图片转 3D 资产生成
| 需求 | MoGe-3 | 资产生成 |
|---|---|---|
| 主要目标 | 恢复可见场景几何 | 生成完整、可复用的物体 |
| 典型输入 | 场景或物体照片 | 清晰的主体参考图 |
| 不可见表面 | 不等于对隐藏几何的测量 | 由生成模型补全 |
| 常用输出 | 深度/点图、GLB、PLY | 物体网格与材质 |
常见问题
MoGe-3 就是 TRELLIS 3 吗?
不是。MoGe-3 是独立的几何估计项目。TRELLIS 模型生成 3D 资产,MoGe 根据图像中的可见证据估计几何。
MoGe-3 有哪些检查点可选?
官方提供 3.7 亿参数的 ViT-L 和 12.5 亿参数的 ViT-G,两者均支持真实尺度几何和法线图。下载所选检查点后,通过 --pretrained 传入,并设置 --version v3。
官方 MoGe-3 代码能在 macOS 运行吗?
当前仓库明确说明不支持 macOS,因为 FlexGEMM 依赖 Triton,而 Triton 没有 macOS 安装包。可以使用兼容环境或官方浏览器演示。
有在线演示或 ComfyUI 集成吗?
项目提供 Ruicheng/MoGe-3 Hugging Face 演示。2026 年 9 月 21 日发布的 ComfyUI v0.37.0 也加入了 MoGe 3 支持。