MoGe-3 es un modelo de estimación geométrica desarrollado por investigadores de Tsinghua, USTC y Microsoft Research. Predice profundidad métrica, mapas de puntos, normales y geometría de cámara a partir de una foto para edición con profundidad y reconstrucción de escenas.
Por qué refinar las estructuras finas en 3D
Píxeles cercanos pueden pertenecer a superficies lejanas en 3D. Mezclar sus características puede suavizar barandillas, plantas y objetos pequeños.
Self-Guided Sparse Refinement eleva el mapa inicial a una envolvente de vóxeles. Convoluciones 3D dispersas usan vecinos espaciales y varias iteraciones recuperan detalles más finos.
Qué puedes exportar desde una fotografía
Las herramientas MoGe admiten mapas de puntos, profundidad, normales y campo de visión de cámara. La CLI puede guardar mapas y geometría GLB/PLY.
GLB guarda los colores de la imagen como textura para inspeccionarlos en un visor 3D. PLY guarda los colores en los vértices para geometría y nubes de puntos. Elige el formato según tu editor o flujo de procesamiento.
Ejecutar MoGe-3 con un checkpoint explícito
Usa Python 3.10 o posterior e instala las dependencias del repositorio. Selecciona el modelo con --version v3 y proporciona el checkpoint MoGe-3 mediante --pretrained PATH_TO_CKPT.pt.
El comando siguiente exporta mapas y geometría con tres pasos de refinamiento. Más pasos no equivalen a mayor resolución: compara primero estructuras finas y límites.
moge infer -i photo.jpg \
--version v3 \
--pretrained PATH_TO_CKPT.pt \
--refine_steps 3 \
--output output \
--maps --glb --ply Geometría de escena o recurso completo
Usa MoGe-3 para la distribución de superficies visibles: composiciones con profundidad, una superficie inicial de habitación e inspección geométrica.
Para un producto, accesorio o personaje completo que se vea desde todos los lados, usa generación de imagen a 3D. Ambos pueden producir un archivo 3D, pero resuelven necesidades diferentes.
MoGe-3 y generación de recursos 3D
| Necesidad | MoGe-3 | Generación de recursos |
|---|---|---|
| Objetivo | Geometría visible de escena | Objeto completo reutilizable |
| Entrada | Foto de escena u objeto | Referencia clara del sujeto |
| Superficies ocultas | No es una medición de zonas invisibles | Completadas por generación |
| Salidas | Profundidad, puntos, GLB, PLY | Malla y materiales |
Preguntas frecuentes
¿MoGe-3 es TRELLIS 3?
No, es un proyecto separado. TRELLIS genera recursos; MoGe estima geometría desde la evidencia visible de una imagen.
¿Qué checkpoints MoGe-3 puedo elegir?
Las versiones oficiales incluyen ViT-L con 370 millones de parámetros y ViT-G con 1.250 millones. Ambas admiten geometría métrica y mapas de normales. Descarga el checkpoint elegido y pásalo con --pretrained junto con --version v3.
¿El código oficial funciona en macOS?
El repositorio indica que no: FlexGEMM depende de Triton sin paquetes macOS. Usa un entorno compatible o la demo oficial.
¿Hay demo o integración ComfyUI?
El proyecto enlaza Ruicheng/MoGe-3 en Hugging Face. ComfyUI v0.37.0, del 21 de septiembre de 2026, también añade MoGe 3.