MoGe-3 é um modelo de estimativa geométrica desenvolvido por pesquisadores da Tsinghua, USTC e Microsoft Research. Prevê profundidade métrica, mapas de pontos, normais e geometria da câmera a partir de uma foto para edição com profundidade e reconstrução de cenas.
Por que refinar estruturas finas em 3D
Pixels próximos podem pertencer a superfícies distantes em 3D. Misturar suas características pode suavizar grades, plantas e objetos pequenos.
Self-Guided Sparse Refinement leva o mapa inicial para uma casca de voxels. Convoluções 3D esparsas usam vizinhos espaciais e sucessivas iterações recuperam detalhes mais finos.
O que uma fotografia permite exportar
As ferramentas MoGe suportam mapas de pontos, profundidade, normais e campo de visão da câmera. A CLI salva mapas e arquivos geométricos GLB/PLY.
GLB salva as cores da imagem como textura para inspeção em um visualizador 3D. PLY salva as cores nos vértices para geometria e nuvens de pontos. Escolha o formato adequado ao editor ou fluxo de processamento.
Executar MoGe-3 com checkpoint explícito
Use Python 3.10 ou superior e instale as dependências do repositório. Selecione o modelo com --version v3 e informe o checkpoint MoGe-3 por meio de --pretrained PATH_TO_CKPT.pt.
O comando abaixo exporta mapas e geometria com três etapas de refinamento. Mais etapas não equivalem a resolução maior: compare estruturas finas e limites antes de aumentar.
moge infer -i photo.jpg \
--version v3 \
--pretrained PATH_TO_CKPT.pt \
--refine_steps 3 \
--output output \
--maps --glb --ply Geometria de cena ou objeto completo
Use MoGe-3 para a disposição de superfícies visíveis: composições com profundidade, uma superfície inicial de sala e inspeção geométrica.
Para produto, adereço ou personagem completo visto de todos os lados, use geração de imagem para 3D. Ambos produzem arquivos 3D, mas resolvem necessidades diferentes.
MoGe-3 e geração de objetos 3D
| Necessidade | MoGe-3 | Geração de objetos |
|---|---|---|
| Objetivo | Geometria visível da cena | Objeto completo reutilizável |
| Entrada | Foto de cena ou objeto | Referência nítida do sujeito |
| Superfícies ocultas | Não mede regiões invisíveis | Completadas por geração |
| Saídas | Profundidade, pontos, GLB, PLY | Malha e materiais |
Perguntas frequentes
MoGe-3 é o TRELLIS 3?
Não, é um projeto separado. TRELLIS gera objetos; MoGe estima geometria a partir de evidências visíveis da imagem.
Quais checkpoints MoGe-3 estão disponíveis?
As versões oficiais incluem ViT-L com 370 milhões de parâmetros e ViT-G com 1,25 bilhão. Ambas oferecem geometria métrica e mapas de normais. Baixe o checkpoint escolhido e passe-o com --pretrained junto com --version v3.
O código oficial funciona no macOS?
O repositório informa que não: FlexGEMM depende de Triton sem pacotes macOS. Use ambiente compatível ou a demo oficial.
Existe demo ou integração ComfyUI?
O projeto oferece Ruicheng/MoGe-3 no Hugging Face. ComfyUI v0.37.0, de 21 de setembro de 2026, também adiciona MoGe 3.