MoGe-3 est un modèle d'estimation géométrique développé par des chercheurs de Tsinghua, de l'USTC et de Microsoft Research. À partir d'une photo, il prédit profondeur métrique, cartes de points, normales et géométrie de caméra pour l'édition avec profondeur et la reconstruction de scènes.
Pourquoi affiner les structures fines en 3D
Deux pixels proches peuvent représenter des surfaces éloignées en 3D. Mélanger leurs caractéristiques peut lisser les barrières, plantes et petits objets.
Le Self-Guided Sparse Refinement place la carte initiale dans une coque de voxels. Des convolutions 3D sparse utilisent le voisinage spatial et plusieurs passages récupèrent des structures plus fines.
Ce qu'une photo permet d'exporter
La chaîne MoGe prend en charge cartes de points, profondeur, normales et champ de vision de la caméra. La commande d'inférence peut enregistrer les cartes et des fichiers GLB/PLY.
Le GLB conserve les couleurs de l'image dans une texture pour l'inspection dans un visualiseur 3D. Le PLY enregistre les couleurs sur les sommets pour le traitement géométrique et les nuages de points. Choisissez selon votre éditeur ou votre chaîne de traitement.
Lancer MoGe-3 avec un checkpoint explicite
Utilisez Python 3.10 ou plus récent et installez les dépendances du dépôt. Sélectionnez le modèle avec --version v3, puis indiquez le checkpoint MoGe-3 avec --pretrained PATH_TO_CKPT.pt.
La commande ci-dessous exporte cartes et géométrie avec trois étapes de raffinement. Ajouter des étapes n'équivaut pas à augmenter la résolution : comparez d'abord structures fines et frontières.
moge infer -i photo.jpg \
--version v3 \
--pretrained PATH_TO_CKPT.pt \
--refine_steps 3 \
--output output \
--maps --glb --ply Géométrie de scène ou objet complet ?
Utilisez MoGe-3 pour comprendre l'agencement des surfaces visibles : compositions avec profondeur, première surface d'une pièce et inspection géométrique.
Pour un produit, accessoire ou personnage complet à observer sous tous les angles, choisissez la génération image-vers-3D. Les deux méthodes peuvent produire un fichier 3D, mais répondent à des besoins différents.
MoGe-3 et génération d'objets 3D
| Besoin | MoGe-3 | Génération d'objets |
|---|---|---|
| Objectif | Géométrie visible de la scène | Objet complet réutilisable |
| Entrée | Photo de scène ou d'objet | Référence nette du sujet |
| Surfaces cachées | Pas une mesure des zones invisibles | Complétées par génération |
| Sorties utiles | Profondeur, points, GLB, PLY | Maillage et matériaux |
Questions fréquentes
MoGe-3 est-il TRELLIS 3 ?
Non, c'est un projet distinct. TRELLIS génère des objets ; MoGe estime la géométrie visible dans une image.
Quels checkpoints MoGe-3 sont disponibles ?
Les versions officielles comprennent ViT-L avec 370 millions de paramètres et ViT-G avec 1,25 milliard. Les deux prennent en charge la géométrie métrique et les normales. Téléchargez le checkpoint choisi et passez-le avec --pretrained en sélectionnant --version v3.
Le code officiel fonctionne-t-il sur macOS ?
Le dépôt indique que macOS n'est pas pris en charge : FlexGEMM dépend de Triton, sans paquets macOS. Utilisez un environnement compatible ou la démo officielle.
Existe-t-il une démo ou une intégration ComfyUI ?
Le projet propose Ruicheng/MoGe-3 sur Hugging Face. ComfyUI v0.37.0, publié le 21 septembre 2026, ajoute aussi MoGe 3.