RenderFormer-V2:3DシーンをAIでレンダリング

1つの学習済みTransformerでガラス、間接光、煙、精細な室内を描画。既存の3Dシーンから画像を生成します。

室内、ガラス、光沢、ボリュームを含むRenderFormer-V2の9作例
同じモデルで9つのシーンを描画。室内、屈折、光を散乱・吸収する媒体、テクスチャ表面を含みます。 RenderFormer-V2

Stanford、Microsoft Research、William & MaryによるECCV 2026の研究です。幾何、材質、光源、カメラを入力し、同じ重みでさまざまなシーンを描画します。シーン別の学習は不要で、ネイティブ512・2048出力モデルがあります。

対応する光の表現

V2は屈折、環境照明、ボリューム散乱、テクスチャ、変位に対応します。ガラスは背景を変形させ、HDR環境はシーンを照らし、媒体は可視性と光輸送を変えます。

材質には固定GGXパラメータだけでなく学習した外観表現を使います。接触影、周囲の反射、ガラスの透過を見て効果を評価できます。

シーンデータからピクセルへ

三角形、ボリューム、面光源、環境マップ、カメラ光線を同じトークン列にします。視点非依存段階で相互作用を処理し、視点依存段階でカメラ画像を作ります。

局所注意とグローバルな注意シンクにより128K超のプリミティブを扱います。V1は約4K三角形規模でした。ネットワーク内部で従来の光線追跡を実行するのではなく、光輸送を学習します。

シーンのトークンは視点に依存しない照明段階を通り、その後の視点依存段階でピクセルになります。
シーンのトークンは視点に依存しない照明段階を通り、その後の視点依存段階でピクセルになります。 RenderFormer-V2

シーンを準備して描画

RenderFormer Studio、Python 3.10または3.11、公式推論環境を使用し、RF2付属例から始めます。Blender V2拡張はprepared-frame中間データを出力し、データ工程で描画用の処理済みH5へ生成・変換します。

以下はtransformer_512のコマンドです。ネイティブ2048出力にはtransformer_2048と対応解像度を選びます。材質・テクスチャ関連部品も含むため、V1ローダーではなくV2パイプラインを使います。

renderformer infer \
  --input processed/scene.h5 \
  --checkpoint RenderFormer/renderformer-v2 \
  --checkpoint-subfolder transformer_512 \
  --precision fp16 \
  --output-dir outputs

3D制作で使う段階

V2はアセット生成とシーン構築の後に使います。物体をBlenderに配置し、材質と照明を設定してからデータを準備します。MoGe-3は写真から可視幾何を復元する前段階のツールです。

出力は入力シーンの画像であり、新しいメッシュではありません。V2は材質や照明を探索し、必要な物体がなければ画像から3Dを作る生成器を使います。

生成・復元・描画の違い

ツール入力 → 出力役割
画像から3D生成参考画像 → アセット幾何と外観を生成
MoGe-3写真 → 深度・可視幾何幾何を復元
RenderFormer-V1三角形シーン → 画像小規模なニューラル描画
RenderFormer-V2混合プリミティブ → 画像屈折・環境光・テクスチャ・媒体

よくある質問

GLBを推論コマンドへ直接入力できますか?

公式V2の入力は準備済みH5シーンです。GLBをBlenderに読み込み、シーンを設定してV2出力とデータ準備を行います。

シーンごとの学習は必要ですか?

不要です。同じ学習済み重みで異なるシーンを描画します。幾何、カメラ、照明を変えても個別の学習は必要ありません。

常にCyclesより高速ですか?

公式測定はNVIDIA A100と、ピクセル当たり4,096適応サンプルのCyclesを使用します。速度はシーン規模、解像度、ハードウェア、品質設定によって変わります。

公式資料

シーンに使う3Dアセットを作成

参考画像から、回転・確認・再利用できる3Dアセットを生成。

3Dアセットを生成