MoGe-3: Detaillierte 3D-Geometrie aus einem Foto rekonstruieren

Rekonstruiere die sichtbare Geometrie einer Szene aus einem Foto. MoGe-3 erhält durch sparse 3D-Verfeinerung dünne Strukturen, kleine Objekte und Tiefengrenzen.

Originalbild aus dem offiziellen MoGe-3-Video zur Geometrieverfeinerung
Vor und nach der MoGe-3-Verfeinerung: geradere Geländer und feinere Geometrie. MoGe-3

MoGe-3 ist ein Geometrieschätzmodell von Forschenden der Tsinghua, USTC und Microsoft Research. Es schätzt metrische Tiefe, Punktkarten, Normalen und Kamerageometrie aus einem Foto für tiefenabhängige Bearbeitung und Szenenrekonstruktion.

Warum dünne Strukturen 3D-Verfeinerung brauchen

Benachbarte Pixel können zu räumlich weit entfernten Oberflächen gehören. Vermischte Merkmale glätten dann Geländer, Pflanzen und kleine Objekte.

Self-Guided Sparse Refinement überführt die Ausgangskarte in eine Voxelschale. Sparse 3D-Faltungen nutzen räumliche Nachbarn; wiederholte Schritte stellen feinere Strukturen wieder her.

Offizielle Ergebnisse: Geometrie aus einem Bild mit feineren Details. MoGe-3
MoGe-3 überführt eine grobe Punktkarte in eine sparse Voxelschale.
MoGe-3 überführt eine grobe Punktkarte in eine sparse Voxelschale. MoGe-3

Was du aus einem Foto exportieren kannst

Die MoGe-Werkzeuge unterstützen Punkt-, Tiefen- und Normalenkarten sowie das Kamera-Sichtfeld. Der Inferenzbefehl speichert Karten und GLB-/PLY-Geometrie.

GLB speichert die Bildfarben als Textur zur Betrachtung in einem 3D-Viewer. PLY speichert Farben an den Vertices für Geometrie- und Punktwolken-Workflows. Wählen Sie das Format passend zum Editor oder zur Verarbeitungskette.

MoGe-3 mit einem Checkpoint ausführen

Verwenden Sie Python 3.10 oder neuer und installieren Sie die Abhängigkeiten des Repositorys. Wählen Sie das Modell mit --version v3 und übergeben Sie den MoGe-3-Checkpoint mit --pretrained PATH_TO_CKPT.pt.

Der folgende Befehl exportiert Karten und Geometrie mit drei Verfeinerungsschritten. Mehr Schritte sind nicht dasselbe wie höhere Eingabeauflösung: prüfe zuerst dünne Strukturen und Grenzen.

moge infer -i photo.jpg \
  --version v3 \
  --pretrained PATH_TO_CKPT.pt \
  --refine_steps 3 \
  --output output \
  --maps --glb --ply

Szenengeometrie oder vollständiges Asset?

MoGe-3 eignet sich für sichtbare räumliche Beziehungen: tiefenbasierte Bildkomposition, eine erste Raumoberfläche und Geometrieprüfung.

Für ein vollständiges Produkt, Requisit oder eine Figur, die von allen Seiten betrachtet wird, nutze Bild-zu-3D-Generierung. Beide Methoden liefern 3D-Dateien, erfüllen aber unterschiedliche Aufgaben.

MoGe-3 und 3D-Asset-Generierung

BedarfMoGe-3Asset-Generierung
ZielSichtbare SzenengeometrieVollständiges wiederverwendbares Objekt
EingabeFoto einer Szene oder eines ObjektsKlares Referenzbild
Verdeckte FlächenKeine Messung unsichtbarer GeometrieDurch das Modell ergänzt
AusgabenTiefe, Punkte, GLB, PLYObjekt-Mesh und Materialien

Häufige Fragen

Ist MoGe-3 eine TRELLIS-3-Version?

Nein, es ist ein separates Projekt. TRELLIS erzeugt Assets; MoGe schätzt Geometrie aus sichtbaren Bildinformationen.

Welche MoGe-3-Checkpoints stehen zur Auswahl?

Offiziell gibt es ViT-L mit 370 Millionen und ViT-G mit 1,25 Milliarden Parametern. Beide unterstützen metrische Geometrie und Normalenkarten. Laden Sie den gewählten Checkpoint herunter und übergeben Sie ihn mit --pretrained zusammen mit --version v3.

Läuft der offizielle Code auf macOS?

Das Repository unterstützt macOS derzeit nicht: FlexGEMM nutzt Triton ohne macOS-Pakete. Verwende eine kompatible Umgebung oder die offizielle Demo.

Gibt es eine Demo oder ComfyUI-Integration?

Die Projektseite verlinkt Ruicheng/MoGe-3 auf Hugging Face. ComfyUI v0.37.0 vom 21. September 2026 unterstützt ebenfalls MoGe 3.

Offizielle Quellen

Du brauchst ein vollständiges Objekt?

Erzeuge aus einem Referenzbild ein 3D-Asset zum Drehen, Prüfen und Wiederverwenden.

3D-Asset generieren