MoGe-3 ist ein Geometrieschätzmodell von Forschenden der Tsinghua, USTC und Microsoft Research. Es schätzt metrische Tiefe, Punktkarten, Normalen und Kamerageometrie aus einem Foto für tiefenabhängige Bearbeitung und Szenenrekonstruktion.
Warum dünne Strukturen 3D-Verfeinerung brauchen
Benachbarte Pixel können zu räumlich weit entfernten Oberflächen gehören. Vermischte Merkmale glätten dann Geländer, Pflanzen und kleine Objekte.
Self-Guided Sparse Refinement überführt die Ausgangskarte in eine Voxelschale. Sparse 3D-Faltungen nutzen räumliche Nachbarn; wiederholte Schritte stellen feinere Strukturen wieder her.
Was du aus einem Foto exportieren kannst
Die MoGe-Werkzeuge unterstützen Punkt-, Tiefen- und Normalenkarten sowie das Kamera-Sichtfeld. Der Inferenzbefehl speichert Karten und GLB-/PLY-Geometrie.
GLB speichert die Bildfarben als Textur zur Betrachtung in einem 3D-Viewer. PLY speichert Farben an den Vertices für Geometrie- und Punktwolken-Workflows. Wählen Sie das Format passend zum Editor oder zur Verarbeitungskette.
MoGe-3 mit einem Checkpoint ausführen
Verwenden Sie Python 3.10 oder neuer und installieren Sie die Abhängigkeiten des Repositorys. Wählen Sie das Modell mit --version v3 und übergeben Sie den MoGe-3-Checkpoint mit --pretrained PATH_TO_CKPT.pt.
Der folgende Befehl exportiert Karten und Geometrie mit drei Verfeinerungsschritten. Mehr Schritte sind nicht dasselbe wie höhere Eingabeauflösung: prüfe zuerst dünne Strukturen und Grenzen.
moge infer -i photo.jpg \
--version v3 \
--pretrained PATH_TO_CKPT.pt \
--refine_steps 3 \
--output output \
--maps --glb --ply Szenengeometrie oder vollständiges Asset?
MoGe-3 eignet sich für sichtbare räumliche Beziehungen: tiefenbasierte Bildkomposition, eine erste Raumoberfläche und Geometrieprüfung.
Für ein vollständiges Produkt, Requisit oder eine Figur, die von allen Seiten betrachtet wird, nutze Bild-zu-3D-Generierung. Beide Methoden liefern 3D-Dateien, erfüllen aber unterschiedliche Aufgaben.
MoGe-3 und 3D-Asset-Generierung
| Bedarf | MoGe-3 | Asset-Generierung |
|---|---|---|
| Ziel | Sichtbare Szenengeometrie | Vollständiges wiederverwendbares Objekt |
| Eingabe | Foto einer Szene oder eines Objekts | Klares Referenzbild |
| Verdeckte Flächen | Keine Messung unsichtbarer Geometrie | Durch das Modell ergänzt |
| Ausgaben | Tiefe, Punkte, GLB, PLY | Objekt-Mesh und Materialien |
Häufige Fragen
Ist MoGe-3 eine TRELLIS-3-Version?
Nein, es ist ein separates Projekt. TRELLIS erzeugt Assets; MoGe schätzt Geometrie aus sichtbaren Bildinformationen.
Welche MoGe-3-Checkpoints stehen zur Auswahl?
Offiziell gibt es ViT-L mit 370 Millionen und ViT-G mit 1,25 Milliarden Parametern. Beide unterstützen metrische Geometrie und Normalenkarten. Laden Sie den gewählten Checkpoint herunter und übergeben Sie ihn mit --pretrained zusammen mit --version v3.
Läuft der offizielle Code auf macOS?
Das Repository unterstützt macOS derzeit nicht: FlexGEMM nutzt Triton ohne macOS-Pakete. Verwende eine kompatible Umgebung oder die offizielle Demo.
Gibt es eine Demo oder ComfyUI-Integration?
Die Projektseite verlinkt Ruicheng/MoGe-3 auf Hugging Face. ComfyUI v0.37.0 vom 21. September 2026 unterstützt ebenfalls MoGe 3.