Proyecto ECCV 2026 de Stanford, Microsoft Research y William & Mary, V2 recibe geometría, materiales, luces y cámaras. Los mismos pesos sirven para distintas escenas sin entrenamiento específico, con modelos nativos de 512 y 2048.
Efectos de luz disponibles
V2 cubre refracción, luz ambiental, dispersión volumétrica, texturas y desplazamiento. El vidrio modifica el fondo, el entorno HDR ilumina y los volúmenes afectan visibilidad y transporte de luz.
Los materiales usan una representación aprendida de apariencia, no solo parámetros GGX fijos. Revisa sombras de contacto, reflejos del entorno y transmisión a través del vidrio.
De datos de escena a píxeles
Triángulos, volúmenes, luces de área, mapas de entorno y rayos de cámara forman una secuencia de tokens. Primero se modelan interacciones independientes de la vista y después se genera la imagen de cámara.
La atención local y un sumidero global permiten superar 128K primitivas, frente a unas 4K de V1. La red aprende el transporte de luz en vez de ejecutar un trazador de rayos convencional.
Preparar y renderizar una escena
Usa RenderFormer Studio con Python 3.10 o 3.11 y el entorno documentado. Empieza con un ejemplo RF2. La extensión Blender V2 exporta un intermediario prepared-frame, que el proceso de datos genera y convierte a H5 procesado.
El comando usa transformer_512. Para salida nativa 2048, elige transformer_2048 y la resolución correspondiente. El paquete incluye componentes de materiales y texturas: utiliza el pipeline V2, no un cargador V1.
renderformer infer \
--input processed/scene.h5 \
--checkpoint RenderFormer/renderformer-v2 \
--checkpoint-subfolder transformer_512 \
--precision fp16 \
--output-dir outputs Su lugar en el flujo 3D
V2 viene después de crear recursos y montar la escena. Coloca el objeto en Blender, configura materiales y luces y prepara los datos. MoGe-3 recupera antes la geometría visible de una foto.
La salida es una imagen de la escena dada, no una malla nueva. V2 permite explorar materiales y luz; un generador de imagen a 3D crea el objeto que falta.
¿Generación, reconstrucción o renderizado?
| Herramienta | Entrada → salida | Función |
|---|---|---|
| Generador de imagen a 3D | Referencia → recurso 3D | Crear geometría y apariencia |
| MoGe-3 | Foto → profundidad y geometría visible | Recuperar geometría |
| RenderFormer-V1 | Escena de triángulos → imagen | Renderizado neuronal a menor escala |
| RenderFormer-V2 | Escena de primitivas mixtas → imagen | Refracción, entorno, texturas y volúmenes |
Preguntas frecuentes
¿Puedo entregar un GLB directamente al comando?
La entrada V2 documentada es una escena H5 preparada. Importa el GLB en Blender, configura la escena y sigue la exportación y preparación V2.
¿Hay que entrenar cada escena?
No. Los mismos pesos preentrenados renderizan diferentes escenas. Cambiar geometría, cámaras o luces no exige entrenamiento por escena.
¿Siempre es más rápido que Cycles?
Las mediciones oficiales usan NVIDIA A100 y Cycles con 4.096 muestras adaptativas por píxel. La velocidad depende de la escena, resolución, hardware y calidad.