RenderFormer-V2: renderizado IA de escenas 3D

Un transformer preentrenado renderiza vidrio, luz indirecta, humo e interiores detallados. Convierte una escena 3D existente en una imagen.

Nueve resultados RenderFormer-V2 con interiores, vidrio, brillo y volúmenes
Un modelo renderiza las nueve escenas, incluidos interiores, refracción y medios participantes. RenderFormer-V2

Proyecto ECCV 2026 de Stanford, Microsoft Research y William & Mary, V2 recibe geometría, materiales, luces y cámaras. Los mismos pesos sirven para distintas escenas sin entrenamiento específico, con modelos nativos de 512 y 2048.

Efectos de luz disponibles

V2 cubre refracción, luz ambiental, dispersión volumétrica, texturas y desplazamiento. El vidrio modifica el fondo, el entorno HDR ilumina y los volúmenes afectan visibilidad y transporte de luz.

Los materiales usan una representación aprendida de apariencia, no solo parámetros GGX fijos. Revisa sombras de contacto, reflejos del entorno y transmisión a través del vidrio.

De datos de escena a píxeles

Triángulos, volúmenes, luces de área, mapas de entorno y rayos de cámara forman una secuencia de tokens. Primero se modelan interacciones independientes de la vista y después se genera la imagen de cámara.

La atención local y un sumidero global permiten superar 128K primitivas, frente a unas 4K de V1. La red aprende el transporte de luz en vez de ejecutar un trazador de rayos convencional.

Los tokens pasan por una etapa de iluminación independiente de la vista y otra que produce los píxeles.
Los tokens pasan por una etapa de iluminación independiente de la vista y otra que produce los píxeles. RenderFormer-V2

Preparar y renderizar una escena

Usa RenderFormer Studio con Python 3.10 o 3.11 y el entorno documentado. Empieza con un ejemplo RF2. La extensión Blender V2 exporta un intermediario prepared-frame, que el proceso de datos genera y convierte a H5 procesado.

El comando usa transformer_512. Para salida nativa 2048, elige transformer_2048 y la resolución correspondiente. El paquete incluye componentes de materiales y texturas: utiliza el pipeline V2, no un cargador V1.

renderformer infer \
  --input processed/scene.h5 \
  --checkpoint RenderFormer/renderformer-v2 \
  --checkpoint-subfolder transformer_512 \
  --precision fp16 \
  --output-dir outputs

Su lugar en el flujo 3D

V2 viene después de crear recursos y montar la escena. Coloca el objeto en Blender, configura materiales y luces y prepara los datos. MoGe-3 recupera antes la geometría visible de una foto.

La salida es una imagen de la escena dada, no una malla nueva. V2 permite explorar materiales y luz; un generador de imagen a 3D crea el objeto que falta.

¿Generación, reconstrucción o renderizado?

HerramientaEntrada → salidaFunción
Generador de imagen a 3DReferencia → recurso 3DCrear geometría y apariencia
MoGe-3Foto → profundidad y geometría visibleRecuperar geometría
RenderFormer-V1Escena de triángulos → imagenRenderizado neuronal a menor escala
RenderFormer-V2Escena de primitivas mixtas → imagenRefracción, entorno, texturas y volúmenes

Preguntas frecuentes

¿Puedo entregar un GLB directamente al comando?

La entrada V2 documentada es una escena H5 preparada. Importa el GLB en Blender, configura la escena y sigue la exportación y preparación V2.

¿Hay que entrenar cada escena?

No. Los mismos pesos preentrenados renderizan diferentes escenas. Cambiar geometría, cámaras o luces no exige entrenamiento por escena.

¿Siempre es más rápido que Cycles?

Las mediciones oficiales usan NVIDIA A100 y Cycles con 4.096 muestras adaptativas por píxel. La velocidad depende de la escena, resolución, hardware y calidad.

Fuentes oficiales

Crea un recurso 3D para tu escena

Genera desde una referencia un recurso 3D que puedas girar, revisar y reutilizar.

Generar un recurso 3D