RenderFormer-V2: KI-Rendering für 3D-Szenen

Ein vortrainierter Transformer rendert Glas, indirektes Licht, Rauchvolumen und detaillierte Innenräume. Aus einer vorhandenen 3D-Szene wird ein Bild.

Neun RenderFormer-V2-Bilder mit Innenräumen, Glas, Glanzmaterialien und Volumen
Ein Modell rendert alle neun Szenen, einschließlich Innenräumen, Lichtbrechung und teilnehmenden Medien. RenderFormer-V2

Das ECCV-2026-Projekt von Stanford, Microsoft Research und William & Mary verarbeitet Geometrie, Materialien, Licht und Kameras. Dieselben Gewichte rendern unterschiedliche Szenen ohne szenenspezifisches Training; native 512- und 2048-Modelle sind verfügbar.

Unterstützte Lichteffekte

V2 unterstützt Brechung, Umgebungslicht, Volumenstreuung, Texturen und Displacement. Glas verändert den Hintergrund, HDR-Umgebungen beleuchten die Szene und Volumen beeinflussen Sichtbarkeit und Lichttransport.

Materialien verwenden eine gelernte Erscheinungsdarstellung statt nur fester GGX-Parameter. Prüfe Kontaktschatten, Umgebungsreflexionen und Glasdurchlässigkeit, nicht nur Farben.

Von Szenendaten zu Pixeln

Dreiecke, Volumen, Flächenlichter, Umgebungskarten und Kamerastrahlen werden zu einer Tokenfolge. Erst werden ansichtsunabhängige Interaktionen modelliert, dann das Kamerabild erzeugt.

Lokale Attention und ein globaler Attention-Sink ermöglichen mehr als 128K Primitive gegenüber etwa 4K Dreiecken bei V1. Das Netz lernt Lichttransport, statt intern einen üblichen Raytracer auszuführen.

Szenen-Tokens durchlaufen eine ansichtsunabhängige Lichtstufe und anschließend eine pixelgenerierende, ansichtsabhängige Stufe.
Szenen-Tokens durchlaufen eine ansichtsunabhängige Lichtstufe und anschließend eine pixelgenerierende, ansichtsabhängige Stufe. RenderFormer-V2

Szenen vorbereiten und rendern

Nutze RenderFormer Studio mit Python 3.10 oder 3.11 und der dokumentierten Inferenzumgebung. Beginne mit einem RF2-Beispiel. Die Blender-V2-Erweiterung exportiert prepared-frame-Zwischendaten, die anschließend zu verarbeitetem H5 generiert und konvertiert werden.

Der Befehl nutzt transformer_512. Für native 2048-Ausgabe wähle transformer_2048 mit passender Auflösung. Das Bundle enthält Material- und Texturkomponenten; verwende die V2-Pipeline statt eines V1-Loaders.

renderformer infer \
  --input processed/scene.h5 \
  --checkpoint RenderFormer/renderformer-v2 \
  --checkpoint-subfolder transformer_512 \
  --precision fp16 \
  --output-dir outputs

Einordnung in den 3D-Workflow

V2 folgt auf Asset-Erzeugung und Szenenaufbau. Platziere das Objekt in Blender, definiere Material und Licht und bereite die Daten vor. MoGe-3 rekonstruiert dagegen zunächst sichtbare Geometrie aus Fotos.

Ausgegeben wird ein Bild der vorhandenen Szene, kein neues Mesh. V2 dient zur Untersuchung von Material und Licht; ein Bild-zu-3D-Generator erstellt fehlende Objektassets.

Erzeugen, rekonstruieren oder rendern?

WerkzeugEingabe → AusgabeAufgabe
Bild-zu-3D-GeneratorVorlage → ObjektassetGeometrie und Erscheinung erzeugen
MoGe-3Foto → Tiefe und sichtbare GeometrieGeometrie rekonstruieren
RenderFormer-V1Dreiecksszene → BildNeuronales Rendering kleinerer Szenen
RenderFormer-V2Gemischte Szenenprimitive → BildBrechung, Umgebung, Texturen und Volumen

Häufige Fragen

Kann die Inferenz direkt GLB lesen?

Der dokumentierte V2-Eingang ist eine vorbereitete H5-Szene. Importiere GLB in Blender, richte die Szene ein und nutze den V2-Export samt Datenvorbereitung.

Muss jede Szene neu trainiert werden?

Nein. Dieselben vortrainierten Gewichte rendern verschiedene Szenen. Geometrie-, Kamera- oder Lichtänderungen benötigen kein separates Szenentraining.

Ist es immer schneller als Cycles?

Offizielle Messungen verwenden eine NVIDIA A100 und Cycles mit 4.096 adaptiven Samples pro Pixel. Szenengröße, Auflösung, Hardware und Qualitätsniveau beeinflussen die Geschwindigkeit.

Offizielle Quellen

Erstelle ein 3D-Asset für deine Szene

Erzeuge aus einem Referenzbild ein 3D-Asset zum Drehen, Prüfen und Wiederverwenden.

3D-Asset generieren