MoGe-3: recupera geometría 3D detallada desde una foto

Recupera la geometría visible de una escena desde una foto. El refinamiento 3D disperso de MoGe-3 conserva estructuras finas, objetos pequeños y bordes de profundidad.

Fotograma oficial de MoGe-3 mostrando refinamiento geométrico
Antes y después del refinamiento de MoGe-3: barandillas más rectas y geometría más fina. MoGe-3

MoGe-3 es un modelo de estimación geométrica desarrollado por investigadores de Tsinghua, USTC y Microsoft Research. Predice profundidad métrica, mapas de puntos, normales y geometría de cámara a partir de una foto para edición con profundidad y reconstrucción de escenas.

Por qué refinar las estructuras finas en 3D

Píxeles cercanos pueden pertenecer a superficies lejanas en 3D. Mezclar sus características puede suavizar barandillas, plantas y objetos pequeños.

Self-Guided Sparse Refinement eleva el mapa inicial a una envolvente de vóxeles. Convoluciones 3D dispersas usan vecinos espaciales y varias iteraciones recuperan detalles más finos.

Resultados oficiales: geometría desde una imagen con detalle refinado. MoGe-3
MoGe-3 eleva un mapa de puntos inicial a una envolvente de vóxeles dispersos.
MoGe-3 eleva un mapa de puntos inicial a una envolvente de vóxeles dispersos. MoGe-3

Qué puedes exportar desde una fotografía

Las herramientas MoGe admiten mapas de puntos, profundidad, normales y campo de visión de cámara. La CLI puede guardar mapas y geometría GLB/PLY.

GLB guarda los colores de la imagen como textura para inspeccionarlos en un visor 3D. PLY guarda los colores en los vértices para geometría y nubes de puntos. Elige el formato según tu editor o flujo de procesamiento.

Ejecutar MoGe-3 con un checkpoint explícito

Usa Python 3.10 o posterior e instala las dependencias del repositorio. Selecciona el modelo con --version v3 y proporciona el checkpoint MoGe-3 mediante --pretrained PATH_TO_CKPT.pt.

El comando siguiente exporta mapas y geometría con tres pasos de refinamiento. Más pasos no equivalen a mayor resolución: compara primero estructuras finas y límites.

moge infer -i photo.jpg \
  --version v3 \
  --pretrained PATH_TO_CKPT.pt \
  --refine_steps 3 \
  --output output \
  --maps --glb --ply

Geometría de escena o recurso completo

Usa MoGe-3 para la distribución de superficies visibles: composiciones con profundidad, una superficie inicial de habitación e inspección geométrica.

Para un producto, accesorio o personaje completo que se vea desde todos los lados, usa generación de imagen a 3D. Ambos pueden producir un archivo 3D, pero resuelven necesidades diferentes.

MoGe-3 y generación de recursos 3D

NecesidadMoGe-3Generación de recursos
ObjetivoGeometría visible de escenaObjeto completo reutilizable
EntradaFoto de escena u objetoReferencia clara del sujeto
Superficies ocultasNo es una medición de zonas invisiblesCompletadas por generación
SalidasProfundidad, puntos, GLB, PLYMalla y materiales

Preguntas frecuentes

¿MoGe-3 es TRELLIS 3?

No, es un proyecto separado. TRELLIS genera recursos; MoGe estima geometría desde la evidencia visible de una imagen.

¿Qué checkpoints MoGe-3 puedo elegir?

Las versiones oficiales incluyen ViT-L con 370 millones de parámetros y ViT-G con 1.250 millones. Ambas admiten geometría métrica y mapas de normales. Descarga el checkpoint elegido y pásalo con --pretrained junto con --version v3.

¿El código oficial funciona en macOS?

El repositorio indica que no: FlexGEMM depende de Triton sin paquetes macOS. Usa un entorno compatible o la demo oficial.

¿Hay demo o integración ComfyUI?

El proyecto enlaza Ruicheng/MoGe-3 en Hugging Face. ComfyUI v0.37.0, del 21 de septiembre de 2026, también añade MoGe 3.

Fuentes oficiales

¿Necesitas un objeto completo?

Genera desde una referencia un recurso 3D que puedas girar, revisar y reutilizar.

Generar un recurso 3D