1. 引言

逆渲染是计算机视觉和图形学领域的一项基础任务,旨在从视觉观测结果中还原场景的本征属性,包括反照率、粗糙度和金属度。该技术在众多实际领域中都至关重要:在影视和动画制作中,通过从真实场景采集结果中重建物理属性精准的材质,可实现高效的数字资产创建[98,100,118];在增强现实(AR)和虚拟现实(VR)领域,通过匹配场景的材质属性,能让虚拟物体与真实环境实现无缝融合[17,74,78];在机器人领域,通过推断物体表面的物理特征,可提升机器人对场景的理解能力,助力物体操作等任务的完成[14,101,111]。除上述应用外,逆渲染还是推进基于物理的渲染(PBR)流程的核心基础,搭建起了基于图像的感知技术与三维场景重建技术之间的桥梁。

尽管逆渲染意义重大,但现有方法仍存在诸多关键缺陷,阻碍了其实际落地应用。第一,绝大多数方法依赖迭代优化框架[2,9,33,41,45,61,72,87,96,108,116],这类方法虽能生成高保真的结果,却存在极高的计算成本,单个场景的处理往往需要数分钟甚至数小时,无法应用于实时或大规模场景。第二,部分单视角本征分解方法[16,52,54-56,120]借助前馈网络实现了快速推理,但其向多视角场景的扩展却面临多视角一致性缺失的问题:同一三维区域在不同视角下的材质预测结果往往存在偏差,导致重建场景出现不真实的伪影。第三,近年来基于扩散模型的渲染器在图像和视频逆渲染任务中展现出良好效果[47,59,110],但这类模型本身的生成特性和迭代采样过程使其计算成本居高不下,继承了基于优化的方法在速度上的局限性。因此,研发一种能兼顾速度与精度的逆渲染解决方案,仍是当前亟待解决的开放性难题。

前馈式三维重建技术近年来取得了突破性进展,基于视觉Transformer(ViT)的模型以直接的端到端预测替代了冗长的优化流程,彻底革新了该领域[43,66,90,93],这一成果为我们的研究提供了思路。多视角逆渲染与这类重建技术存在一个关键共性:二者传统上均依赖反复的渲染迭代来求解本征属性(逆渲染求解材质属性,三维重建求解几何属性)。这一相似性启示我们,将前馈范式融入逆渲染领域,是一个合理且尚未被探索的研究方向。借助基于Transformer架构的高效性,将多视角输入直接映射为材质属性,我们有望突破基于优化和扩散模型的方法在速度上的瓶颈,同时解决单目方法的一致性问题。

基于上述研究动机,我们提出了MVInverse模型——一种新型前馈模型,仅需数秒即可为所有输入视角预测出反照率、粗糙度、金属度,以及相机空间法向量和漫反射着色图。受当前顶尖的前馈式三维重建架构[90,93]启发,我们设计了一种带有全局-帧间交替注意力机制的Transformer骨干网络:全局注意力机制显式地关联不同视角下对应的三维区域,而帧间注意力机制则捕捉单张图像内的帧内交互。这种交替注意力的设计能提取出高效的、与视角对齐的特征,为后续的材质和法向量预测奠定坚实基础。如图2所示,注意力可视化结果表明,我们的模型能有效捕捉长距离光照依赖关系(红色区域块)和帧间一致性(蓝色区域块),凸显了交替注意力机制的双重作用。

逆渲染领域面临的另一大挑战是高质量真实世界训练数据的匮乏。现有方法大多基于合成数据集进行训练[25,50,51,79,92,119,120],导致模型在真实场景中的泛化能力较差,尤其容易出现闪烁伪影——同一三维区域的材质属性在不同视角或帧间呈现出不一致的波动。为缓解这一问题,我们采用两阶段训练策略:首先在大规模合成数据集上对模型进行预训练,学习通用的材质先验知识;随后在真实世界数据上微调时,引入自监督的一致性约束。该约束强制要求从不同视角观测到的同一三维点,其材质预测结果保持一致,大幅提升了模型在真实环境中的泛化能力,同时消除了闪烁伪影。

我们在主流基准数据集上对该方法进行了验证,结果表明,模型在单视角逆渲染质量、多视角材质一致性、法向量预测精度以及视频时序性能上均表现优异。此外,将本方法与现有的前馈式三维重建流程相结合,可快速得到带纹理的点云,仅需数秒就能实现视频重光照、视角一致性材质编辑等多种下游应用。这一高效的端到端流程大幅降低了技术落地的门槛,为构建高可扩展性的、基于数据驱动的材质理解系统铺平了道路。

2. 相关工作

单视角逆渲染

逆渲染的目标是将场景分解为几何结构、材质属性和光照信息三部分[6]。这是一项本质上具有病态性的任务,因为不同的属性组合可能生成相同的视觉图像。早期方法依赖人工设计的先验知识和物理启发式规则来约束问题求解[4,6,7,31,36,49,82,83,114,117],但这些方法的适用范围往往受限于其底层假设,难以适配多样的真实场景。

深度学习的出现推动该领域向数据驱动的技术范式转变。现代方法通常将逆渲染建模为图像到图像的转换问题,在带有真实分解标注的大规模合成数据集上训练稠密预测神经网络[15,16,52,54-56,69,75,80,81,84,94,95,109,112,115,120,121]。这类基于学习的方法能够联合估计空间变化的双向反射分布函数(SVBRDF)、复杂光照和表面法向量。

近年来,生成模型(尤其是扩散模型)被用于逆渲染任务,将其转化为条件图像生成问题[28,29,47,58-60,76,110]。这类模型借助从大规模图像分布中学习到的强先验知识,合成符合物理规律的场景分解结果。但所有单视角方法都存在一个根本性缺陷:无法保证同一场景不同视角下几何和材质属性的一致性。与之相反,本文提出的方法同时利用多个视角的信息,消解了这种模糊性,实现了连贯的场景分解。

多视角逆渲染

多视角逆渲染利用场景的多视角观测信息,更精准地还原几何结构、材质属性和光照信息。早期多视角方法通常依赖显式的几何建模和大量优化操作来联合优化这些要素[2,40,72,96,108],通过迭代优化得到符合物理规律的精准结果。

随着神经场景表示方法的兴起,基于神经辐射场(NeRF)[71]和神经隐式表面(NeuS)[91]的方法成为主流范式[1,9-11,13,21,45,65,87,89,102-104,113,116]。这类方法将辐射度和反射率建模在隐式神经场中,通常需要针对每个场景优化网络参数,以分离与视角相关的外观信息和入射光照信息。

近期,三维高斯溅射(3D Gaussian Splatting)[44]技术被适配到逆渲染任务中[8,18,24,27,33,37,38,41,48,61,85,97,106,107,122],该技术支持实时可微渲染,能实现高效的几何表示,同时结合了部分前馈式三维几何重建方法的优势[30,34,67,90,93]。此外,一些混合方法[20,62,64,68]采用“先估计后优化”的策略,先通过基于学习的方法得到预测结果,再针对具体场景进行优化精修。

尽管研究取得了上述进展,现有绝大多数方法仍需依赖针对特定场景的优化或微调,才能保证材质和光照的一致性。虽然MAIR和MAIR++[22,23]等基于学习的方法在无需优化的情况下实现了多视角逆渲染,但它们的适用范围仍局限于视角变化相对有限的场景。与之不同,本文方法通过单次前馈传播即可完成多视角逆渲染,即使在相机大幅运动的情况下,也能生成连贯的场景分解结果。

3. 方法

在本节中,我们将介绍MVInverse——一种前馈式多视角逆渲染框架,该框架可根据图像序列直接预测多种场景本征属性。3.1节首先阐述问题定义与相关符号表示,3.2节介绍模型架构及设计思路,3.3节提出一种一致性微调方案,以提升模型在真实场景中的泛化能力。

3.1 问题定义与符号表示

给定包含NNN张图像的序列S=(I1,...,IN)S=(I_1,...,I_N)S=(I1,...,IN),其中Ii∈RH×W×3I_i \in \mathbb{R}^{H×W×3}IiRH×W×3,网络fff旨在将该图像序列映射为对应的一组本征图像,满足:
f((Ii)i=1N)=(Ai,Mi,Ri,Ni,Di)i=1N(1)f((I_{i})_{i=1}^{N})=(A_{i},M_{i},R_{i},N_{i},D_{i})_{i=1}^{N} \tag{1}f((Ii)i=1N)=(Ai,Mi,Ri,Ni,Di)i=1N(1)
式中,Ai∈[0,1]H×W×3A_i \in [0,1]^{H×W×3}Ai[0,1]H×W×3为反照率图,表征物体表面的基础反射颜色;Mi∈[0,1]H×WM_i \in [0,1]^{H×W}Mi[0,1]H×W为金属度图;Ri∈[0,1]H×WR_i \in [0,1]^{H×W}Ri[0,1]H×W为粗糙度图;Ni∈[−1,1]H×W×3N_i \in [-1,1]^{H×W×3}Ni[1,1]H×W×3为相机坐标系下的表面法向量图;Di∈[0,1]H×W×3D_i \in [0,1]^{H×W×3}Di[0,1]H×W×3为漫反射着色图,捕捉每个表面点在上方半球空间内接收的总入射辐射度,是漫反射着色效果的决定因素。

3.2 MVInverse模型

特征骨干网络

受前馈式三维重建领域最新研究成果[90,93]启发,我们针对多视角逆渲染的应用场景,设计了与之适配的模型架构(见图3)。

模型采用DINOv2[73]作为视觉特征编码器,该编码器具备优异的泛化能力,能提取具有语义意义的高层特征表示。每张输入图像IiI_iIi经编码后转化为一组视觉特征令牌:Xi=DINOv2(Ii)X_i=\text{DINOv2}(I_i)Xi=DINOv2(Ii),其中Xi∈RT×CX_i \in \mathbb{R}^{T×C}XiRT×CTTT为特征令牌数量,CCC为特征维度。

为同时利用单视角外观特征和跨视角本征属性一致性信息,我们引入了Pi3[93]中的置换等变交替注意力Transformer骨干网络,该网络通过两种互补的注意力操作交替进行,实现特征的深度融合:

  1. 帧间自注意力:在单张图像内部执行注意力计算,通过捕捉长距离空间依赖关系和局部语义结构,优化特征令牌的表示效果;
  2. 全局自注意力:在所有输入图像间执行注意力计算,让不同视角的特征令牌相互参考、强化,无需相机位姿监督,即可隐式关联观测同一三维表面区域的特征令牌。

通过两种注意力操作的渐进式交替执行,网络将丰富的单视角上下文推理信息和全局一致的跨视角信息融入每个特征令牌,得到结构连贯、视角一致的特征表示,为多视角逆渲染提供可靠的特征基础。

本征属性预测头

基于学习到的多视角隐式特征表示,MVInverse通过五个专用的预测头,为每张输入图像预测对应的本征属性,满足:
(Ai,Mi,Ri,Ni,Di)=Head(Xi)\left( A_{i},M_{i},R_{i},N_{i},D_{i}\right) =\text{Head}(X_{i})(Ai,Mi,Ri,Ni,Di)=Head(Xi)
每个预测头均基于DPT风格的稠密预测模块[77]实现,能在输入图像的原始分辨率下,生成像素级对齐的预测结果。

但与深度估计、语义分割等常用DPT模块的任务不同,逆渲染任务对空间细节的保留要求更高。实验发现,单纯使用DPT预测头易导致材质图过度平滑、模糊,尤其是反照率图,其高频纹理细节需要被精准还原。为解决这一问题,我们引入一个辅助多分辨率卷积编码器,从输入图像中提取局部高频结构特征,并通过特征融合将其注入预测头;同时将提取的细粒度细节特征通过跳跃连接传入预测头,在保证纹理清晰度的同时避免不必要的模糊。如图7所示,这种类DPT混合架构[77]大幅提升了预测结果的空间保真度,恢复了材质反射率的细尺度变化特征。

损失函数与训练

针对不同本征属性的特性,模型为每种属性设计了专属的监督损失函数。对于反照率、金属度、粗糙度和漫反射着色,我们参考[16,51,53]的方法,采用均方误差(MSE)损失和多尺度梯度(MSG)损失进行监督:
Lmse(P)=1N∑i=1N(Pi−Pi∗)2(2)\mathcal{L}_{mse}(P)=\frac{1}{N} \sum_{i=1}^{N}\left(P_{i}-P_{i}^{*}\right)^{2} \tag{2}Lmse(P)=N1i=1N(PiPi)2(2)
Lmsg(P)=1NM∑i=1N∑l=1M(∇Pi,l−∇Pi,l∗)2(3)\mathcal{L}_{msg}(P)=\frac{1}{NM} \sum_{i=1}^{N} \sum_{l=1}^{M}\left(\nabla P_{i,l}-\nabla P_{i,l}^{*}\right)^{2} \tag{3}Lmsg(P)=NM1i=1Nl=1M(Pi,lPi,l)2(3)
其中,P∈{A,M,R,D}P \in \{A, M, R, D\}P{A,M,R,D}代表预测的本征属性图(反照率、金属度、粗糙度或漫反射着色),P∗P^*P为对应的真实监督标签,∇Pi,l\nabla P_{i,l}Pi,lPPP在尺度lll下的空间梯度。需说明的是,反照率预测采用尺度不变的均方误差损失,具体细节见补充材料。

表面法向量的训练采用余弦相似度损失,该损失函数更关注法向量的方向正确性,而非原始向量的幅值大小:
Lnormal(Ni)=1−<N^i,Ni>(4)\mathcal{L}_{normal }\left(N_{i}\right)=1-\left<\hat{N}_{i}, N_{i}\right> \tag{4}Lnormal(Ni)=1N^i,Ni(4)

模型采用端到端的训练方式,通过优化一个组合损失函数,同时对反照率、金属度、粗糙度、法向量和着色等多种材质属性进行约束。组合损失函数中,各单项损失均配有权重系数,使模型能联合学习这些物理属性,整体损失函数为:
L=λalbedoLalbedo+λmetallicLmetallic+λroughnessLroughness+λnormalLnormal+λshadingLshading(5) \begin{aligned} \mathcal{L}= & \lambda_{albedo } \mathcal{L}_{albedo }+\lambda_{metallic } \mathcal{L}_{metallic }+\lambda_{roughness } \mathcal{L}_{roughness } \\ & +\lambda_{normal } \mathcal{L}_{normal }+\lambda_{shading } \mathcal{L}_{shading } \end{aligned} \tag{5} L=λalbedoLalbedo+λmetallicLmetallic+λroughnessLroughness+λnormalLnormal+λshadingLshading(5)
式中,λ⋅\lambda_\cdotλ为各损失项的权重系数,L⋅\mathcal{L}_\cdotL为对应材质属性的损失值。实际训练中,我们将所有权重系数均设置为λ∗=1\lambda_*=1λ=1

为保证模型在不同环境下的鲁棒性,我们基于多样化的数据集开展训练,主要训练数据集包括Hypersim[79]、Interiorverse[120]、PRID[92]、Structured3D[119]、Amazon-Berkeley Objects[25]、MatrixCity[50]和CGIntrinsics[51]。由于上述数据集多为合成的室内场景或物体中心型场景,模型对室外场景的泛化能力受限,因此我们额外利用DiffusionRenderer[59],为Sekai[57]-Drone数据集中的1118段真实视频生成反照率伪标签,补充训练数据。更多训练细节和数据集规格见补充材料。

3.3 一致性微调

经预训练后,模型在合成场景中已能生成视角一致的材质预测结果,但应用于真实视频时,同一三维区域的预测结果会出现明显的时序闪烁,导致视觉稳定性较差。我们认为,这一问题的根源在于真实场景缺乏高质量的真实监督标签。

为解决该问题,我们采用两阶段训练策略:在大规模合成数据集上完成预训练后,在真实视频上进行自监督微调,提升模型的时序一致性(见图4)。给定输入帧序列(I0,It,It+1)(I_0, I_t, I_{t+1})(I0,It,It+1),微调后的模型生成对应的材质预测结果(M^0,M^t,M^t+1)(\hat{M}_0, \hat{M}_t, \hat{M}_{t+1})(M^0,M^t,M^t+1);为强化时序连贯性,我们利用成熟的光流网络[88],估计帧It+1I_{t+1}It+1ItI_tIt之间的稠密光流Ft+1→tF_{t+1 \to t}Ft+1t,并根据该光流对预测的材质图M^t+1\hat{M}_{t+1}M^t+1进行扭曲变换,得到M^t+1→twarp\hat{M}_{t+1 \to t}^{warp}M^t+1twarp;通过计算M^t+1→twarp\hat{M}_{t+1 \to t}^{warp}M^t+1twarpM^t\hat{M}_tM^t之间的一致性损失,让相邻帧的材质预测结果在运动状态下保持一致。

若仅采用一致性监督,模型可能得到平凡解或坍缩解,即生成时序平滑但失去语义意义的预测结果。为避免这一问题,我们在第0帧引入锚点损失:由预训练模型生成第0帧的参考材质图M^0pret\hat{M}_0^{pret}M^0pret,要求微调后的模型在该帧的预测结果与参考图匹配。锚点损失在保留预训练模型预测精度的同时,让微调过程能有效提升模型的时序稳定性。

整体微调损失函数为:
Lfinetune=λanchor∥M^0−M^0pred∥22+∥M^t−M^t+1→twarp∥22(6)\mathcal{L}_{finetune }=\lambda_{anchor }\left\| \hat{M}_{0}-\hat{M}_{0}^{pred }\right\| _{2}^{2}+\left\| \hat{M}_{t}-\hat{M}_{t+1 \to t}^{warp }\right\| _{2}^{2} \tag{6}Lfinetune=λanchor M^0M^0pred 22+ M^tM^t+1twarp 22(6)
本研究中,我们设置λanchor=0.1\lambda_{anchor}=0.1λanchor=0.1,平衡锚点损失和一致性损失的贡献。两种损失协同作用,让模型在不损失预训练保真度的前提下,学习到视频稳定的材质预测能力。

4. 实验

我们开展了大量实验,对所提出的前馈式多视角逆渲染框架进行评估。本次评估聚焦三个核心维度:(1)单视角材质估计精度;(2)多视角材质一致性;(3)法向量估计精度。通过定量与定性对比相结合的方式,验证了本方法无需针对特定场景优化,即可实现高效、一致的场景级逆渲染。

4.1 单视角材质估计

我们首先在Interiorverse[120]测试集上评估单视角材质估计性能,该测试集包含2672组图像-材质配对数据。对于反照率预测,采用峰值信噪比(PSNR)、结构相似性(SSIM)和学习感知图像块相似度(LPIPS)作为评价指标;对于粗糙度和金属度预测,采用均方根误差(RMSE)作为评价指标。对比方法选取当前主流的本征分解和逆渲染算法:DiffusionRenderer[59]、ColorfulDiffuse[16]、RGB↔X[110]、IntrinsicImageDiffusion[47],以及早期方法[7]。表1中的定量结果表明,本方法在所有评估指标上均优于所有基线方法,这证明了该方法不仅能更精准地估计反照率和各类材质属性,还能生成视觉感知效果更真实、一致性更强的预测结果。

表1 Interiorverse[120]数据集上的单视角逆渲染定量评估*注:我们以图像模式进行推理,每列最优/次优/第三优结果已突出标注

方法 反照率PSNR↑ 反照率SSIM↑ 反照率LPIPS↓ 金属度RMSE↓ 粗糙度RMSE↓
IIW [7] 9.7 0.47 0.78 0.44 0.38
RGB↔X [110] 16.4 0.62 0.19 0.35 0.76
ColorfulDiffuse [16] 15.2 0.47 - - -
IntrinsicImageDiffusion [47] - - - 0.21 0.28
DiffusionRenderer [59]* 21.9 0.87 0.09 0.22 0.17
本文方法 23.0 0.92 0.09 0.17 0.14

我们还在真实场景本征图像数据集(IIW)[7]上,对零样本真实场景单视角反照率估计结果进行了定性对比,结果如图5所示。在图中上方的场景里,绿色标注区域显示RGB↔X[110]和ColorfulDiffuse[16]未能正确消除光照效果,蓝色标注区域则表明这些方法无法去除画面中猫咪的阴影;此外,橙色标注区域体现出DiffusionRenderer[59]会生成不自然的颜色伪影(例如树叶区域出现红色斑块),且整体色调还原效果欠佳。在图中下方的场景里,红色和蓝色标注区域对应橱柜下方未被现有方法消除的细微阴影,绿色标注区域则突出了吊灯在橱柜上形成的阴影——这类阴影无法被其他模型识别。与之相反,本方法能有效消除上述各类阴影,证明其在复杂光照条件下,具备更优异的阴影去除和反照率恢复能力。

4.2 多视角材质一致性

本节将对比本模型与现有方法的多视角材质一致性表现。由于目前尚无统一的多视角材质一致性评估标准,我们设计了专属的评估方案:选取Hypersim[79]测试集的最后5个场景(所有对比方法在训练阶段均未见过这些场景),对每个场景相机轨迹中的前10个视角进行推理;利用已知的深度图和相机位姿,将其中一个视角的预测材质图(反照率、粗糙度、金属度)反投影至三维世界坐标系,再重投影到其他视角;最后计算重叠区域内重投影材质图与直接预测材质图的均方根误差(RMSE),以此量化跨视角一致性。表2的结果显示,本方法在所有材质通道(反照率、粗糙度、金属度)上均取得了最低的均方根误差,说明相较于现有方法,本方法具备更优的跨视角一致性——这一属性对于下游材质获取类应用至关重要。

表2 反照率、金属度、粗糙度的均方根误差评估结果(在Hypersim[79]多视角图像上完成评估)

方法 反照率RMSE↓ 金属度RMSE↓ 粗糙度RMSE↓
RGB↔X [110] 0.1007 0.2941 0.1065
ColorfulDiffuse [16] 0.1001 - -
IntrinsicImageDiffusion [47] 0.0723 0.0720 0.0630
DiffusionRenderer [59] 0.0826 0.0731 0.0995
本文方法 0.0494 0.0587 0.0235

我们还完成了多视角反照率一致性的定性对比,结果如图6所示。从Mip-NeRF 360[5]数据集的Room场景和Deep Blending数据集的Drjohnson场景中各选取两个视角,分别使用各类方法预测其反照率;借助相机位姿和Pi3[93]估计的深度,将第二个视角的预测结果配准至第一个视角;随后计算并可视化第一个视角的直接预测反照率与第二个视角配准后反照率的误差图——误差图中像素越亮,代表不同视角间的预测结果差异越大。

如图6所示,本模型的误差图中亮像素数量最少,说明跨视角差异显著更低,证明该方法能保持极强的多视角反照率一致性,而其他方法则表现出明显的视角相关预测偏差。

4.3 法向量估计

我们在主流基准数据集上评估零样本表面法向量预测性能,涉及数据集包括NYUv2[86]、ScanNet[26]、iBims-1[46]、Sintel[12]和OASIS[19]。法向量估计性能采用平均角度误差(MAE),以及角度误差低于11.25°和30°的像素占比作为评价指标。对比方法选取当前代表性的主流算法:Omnidata V2[42]、DSINE[3]、GeoWizard[32]、StableNormal[105]、Diffusion-E2E-FT[35]和Lotus-D[39]。

表3的结果显示,本方法在绝大多数数据集和评估指标上均取得最优性能;尤其在五个基准数据集中的四个,本方法实现了最低的平均角度误差和最高的30°角度误差阈值准确率。即便在少数其他模型略优于本方法的场景中,本方法的性能仍位列前三,这证明了该模型在各类不同基准数据集上均具备稳健的泛化能力。

表3 零样本表面法向量估计定量评估(跨五个基准数据集对比,每列最优/次优/第三优结果由深至浅用橙色突出标注)

方法 NYUv2 [86]
mean↓
NYUv2 [86]
11.25°↑
NYUv2 [86]
30°↑
ScanNet [26]
mean↓
ScanNet [26]
11.25°↑
ScanNet [26]
30°↑
iBims-1 [46]
mean↓
iBims-1 [46]
11.25°↑
iBims-1 [46]
30°↑
Sintel [12]
mean↓
Sintel [12]
11.25°↑
Sintel [12]
30°↑
OASIS [19]
mean↓
OASIS [19]
11.25°↑
OASIS [19]
30°↑
Omnidata V2[42] 17.2 55.5 83.0 16.2 60.2 84.7 18.2 63.9 81.1 40.5 14.7 43.5 24.2 27.7 74.2
DSINE[3] 16.4 59.6 83.5 16.2 61.0 84.4 17.1 67.4 82.3 34.9 21.5 52.7 24.4 28.8 72.0
GeoWizard[32] 18.9 50.7 81.5 17.4 53.8 83.5 19.3 63.0 80.3 40.3 12.3 43.5 25.2 23.4 68.1
StableNormal[105] 18.6 53.5 81.7 17.1 57.4 84.1 18.2 65.0 82.4 36.7 14.1 50.7 26.5 23.5 68.7
Diffusion-E2E-FT[35] 16.5 60.4 83.1 14.7 66.1 85.1 16.1 69.7 83.9 33.5 22.3 53.5 23.2 29.4 74.5
Lotus-D[39] 16.2 59.8 83.9 14.7 64.0 86.1 17.1 66.4 83.0 32.3 22.4 57.0 22.3 31.8 76.1
本文方法 16.1 60.2 84.1 14.2 66.3 87.1 16.0 69.2 84.1 31.3 22.9 60.2 23.1 29.6 74.5

4.4 消融实验

辅助多分辨率编码器保留细粒度空间细节

如3.2节所述,我们为DPT风格的本征属性预测头增设了辅助多分辨率编码器,以更好地保留高频空间细节。该设计让网络能在不改变整体架构的前提下,融入输入图像中的细粒度结构特征。如图7所示,引入辅助编码器后,反照率预测结果的细节更丰富、空间连贯性更强,证明了显式建模局部细节对于精准恢复材质属性的重要性。

一致性微调缓解闪烁伪影

如3.3节所述,我们提出了一种自监督微调策略,以提升模型在真实视频上的时序稳定性。为定量评估其有效性,我们在DL3DV[63]数据集的100段测试视频上,分别评估微调前后模型的性能,通过计算相邻帧间的重投影误差作为评价指标。表4的结果显示,一致性微调显著降低了时序闪烁现象,让材质预测结果在时间维度上更平滑、更稳定。

表4 一致性微调的效果评估(在真实视频上对比所提自监督微调策略应用前后的性能)

方法 反照率RMSE↓ 金属度RMSE↓ 粗糙度RMSE↓ 着色RMSE↓
本文方法(微调前) 0.0341 0.0250 0.0119 0.0150
本文方法(微调后) 0.0161 0.0146 0.0084 0.0140

4.5 应用场景

重光照

如图1右侧列所示,本方法可实现高效的视频重光照。给定输入图像序列,模型为每一帧预测视角一致的材质和法向量;结合当前主流的前馈式三维重建方法[93],恢复出每一帧的深度和相机位姿,进而构建带有材质和法向量信息的场景三维点云;随后在该带材质点云上执行基于物理的渲染(PBR),即可添加新的光源,实现场景的实时重光照。针对三幅输入图像,整个流程仅需数秒即可完成,凸显了该前馈式逆渲染框架的高效性和交互性。

视角一致性图像编辑

基于重建得到的、带有PBR材质和法向量的三维点云,我们证明了本方法可在多个输入视角间,实现高效的、视角一致且感知光照的材质编辑。选定需要修改的区域后,直接将目标点的反照率替换为期望的纹理,再利用模型预测的漫反射着色结果重新渲染场景,效果如图8所示。

MVInverse:秒级前馈式多视角逆渲染——补充材料

6. 架构细节

本文补充介绍网络架构的更多细节。模型的DINO编码器与交替注意力Transformer均基于Pi3[93]发布的预训练权重初始化,保障了训练的稳定收敛性与模型的强几何先验能力。对于ResNeXt图像编码器,我们采用[70]提供的公开权重,该权重可为细节保留任务提供鲁棒的多尺度特征表示。遵循Pi3[93]的设计,模型的交替注意力模块包含18个交替注意力块,能够高效聚合多视角信息。

本文同时阐述编码器栈输出的特征融合策略。如图9所示,DINO编码器与ResNeXt骨干网络提取的多尺度特征被投影至共享嵌入空间,并通过轻量级卷积精修块完成融合。该设计在保留视角相关细节的同时,维持了不同视角间的几何一致性。

7. 训练细节

在预训练阶段,我们采用尺度不变重建损失对反照率进行监督。为解决反照率预测中的尺度模糊问题,我们首先通过最小二乘误差最小化方法,估计一个通道级尺度因子,使预测结果与伪真值对齐。具体而言,对于预测反照率图A∈RH×W×3A \in \mathbb{R}^{H×W×3}ARH×W×3和真实反照率图A∗A^*A,计算三通道尺度因子的公式为:
s∗=argmins∈R3∥A⊙s−A∗∥22s^{*}=arg min _{s \in \mathbb{R}^{3}}\left\| A \odot s-A^{*}\right\| _{2}^{2}s=argminsR3AsA22
其中,sss为三维尺度向量,⊙\odot表示通道级逐元素相乘。基于此,尺度不变反照率损失的定义为:
Lmse=1N∥A⊙s∗−A∥22.\mathcal{L}_{mse }=\frac{1}{N}\left\| A \odot s^{*}-A\right\| _{2}^{2} .Lmse=N1AsA22.

该损失函数在训练初期的稳定性较差,因此我们遵循[16,51]的方法,先采用基础均方误差损失对网络进行数轮预热训练,再切换为尺度不变损失函数继续训练。

在整个预训练阶段,DINO编码器与ResNeXt编码器均保持冻结状态,以保留其预训练的特征表示能力。为适配不同的输入帧数,我们采用与VGGT相似的动态批处理策略:每张GPU最多处理12张图像,每个批次由随机采样的、同一场景的2至12张图像构成。对于仅提供单视角图像的数据集(如PRID[92]),我们将每张单目图像在批次维度上复制,以匹配模型要求的输入帧数,等效于将其视为静态相机的多次采集结果。

模型在两台A100 GPU上训练80个轮次,输入图像固定长边分辨率为518(短边分辨率随机采样),每个轮次包含1000次迭代。完成初始训练后,我们冻结所有注意力块,仅对预测头继续训练50个轮次,此时输入图像长边分辨率提升至770。该微调阶段旨在提升模型对高频细节的预测能力,同时保持骨干网络的推理逻辑不变。整个训练流程耗时约3-4天。所有训练阶段均采用Adam优化器,初始学习率设置为5×10−55 ×10^{-5}5×105

表5汇总了所有训练数据集及其对应统计信息。尽管实验所用基准数据集多为室内场景,我们仍额外纳入了MatrixCity[50]和Sekai(基于DiffusionRenderer生成伪标签)两个室外数据集,以及以物体为中心的ABO数据集[25]。遵循[16]的掩码策略,我们通过掩码剔除监督过程中的不可靠区域:若数据集提供镜面或高光表面的掩码,我们将基于该掩码,仅在掩码内区域计算损失;若数据集无相关标注,则掩码剔除反照率值低于0.01或高于0.99的像素,避免这类无信息价值的像素影响模型优化。

表5 数据集汇总表
注:Sekai-Drone[57]采用DiffusionRenderer[59]生成的伪标签;ABO[25]选取随机子集,包含10万张图像。

数据集 图像数量 视角类型 场景类型 本征属性类型
Hypersim [79] 70838 多视角 室内 反照率、法向量、漫反射着色
Structured3D [119] 78463 多视角 室内 反照率、法向量
CGIntrinsic [51] 20160 多视角 室内 反照率
PRID [92] 21478 单视角 室内 反照率
InteriorVerse [120] 52769 多视角 室内 反照率、金属度、粗糙度、法向量
MatrixCity [50] 44804 多视角 室外 反照率、金属度、粗糙度、法向量
Sekai-Drone∗ [57] 127246 多视角 室外 反照率
ABO∗ [25] 100000 多视角 物体中心型 反照率、金属度、粗糙度、法向量

8. 更多定性实验结果

本节展示更多定性实验结果,进一步验证所提前馈式逆渲染模型的有效性、鲁棒性与泛化能力。

单视角预测结果

图11、图12为InteriorVerse[120]数据集上金属度和粗糙度图的补充单视角预测结果。由于正文未对这类材质通道进行定性可视化,本文在此与三款近期主流的基线模型(RGB↔X[110]、IntrinsicImageDiffusion[47]、DiffusionRenderer[59])展开拓展对比。结果表明,相较于其他方法,本文模型的预测结果与真实值更贴合。

同时,本文在图13、图14展示了Hypersim[79]和Structured3D[119]测试集的更多单视角预测结果,在图15展示了IIW[7]真实场景数据集的预测结果。这些示例充分证明,模型在多样的合成场景和真实场景中均具备良好的泛化能力。

多视角预测结果

图16为DL3DV[63]数据集上的多视角预测结果,该数据集包含多样的大规模场景与复杂几何结构,是一项分布外(OOD)基准测试任务。对于每组多视角输入序列,本文可视化了预测得到的反照率、金属度、粗糙度、相机空间法向量和漫反射着色图。所有实验结果表明,本方法在各类场景中均能实现优异的跨视角一致性,生成稳定的材质预测结果。

9. 讨论与局限性

伪标签数据的影响

为提升模型在真实室外场景中的泛化能力,我们利用DiffusionRenderer生成的部分真实世界伪标签,对反照率预测模型进行训练,并在此探讨伪标签对模型的影响。如图10所示,融入伪标签能显著提升模型在复杂区域(如天空附近)的预测质量——这类区域在以室内场景为主的训练数据中代表性不足。具体而言,若未引入伪标签,模型因缺乏室外监督,在天空附近易生成模糊、不一致的反照率结果;而伪标签的引入有效缓解了该问题,使预测结果更清晰、更符合物理规律。

但该方法也存在一定弊端:受伪标签质量的限制,模型在部分区域(如墙面、地面)的反照率预测结果存在偏暗的趋势。尽管在标注室外数据稀缺的前提下,使用伪标签是一种务实的解决方案,但这仍是一种权衡之举。若要进一步提升模型对室外环境的泛化能力,仍需构建覆盖更多样室外分布的高质量数据集。

模型性能的局限性

本方法本质上是数据驱动的,因此在处理分布外(OOD)输入时,性能会受训练数据的分布限制,偶尔会生成色度不准确的预测结果。例如,图16最上方的场景中,木质桌子的反照率预测结果偏暗;中间场景中,木质地板的预测反照率存在明显的色调偏差。但需说明的是,该问题是数据驱动方法的共性缺陷——正文图5中DiffusionRenderer的预测结果(地面有白色猫咪的场景)也体现出类似问题。除扩充训练数据的多样性外,还可遵循[16]的方法,将色度信息显式融入反照率预测过程,以缓解该问题。

此外,金属度和粗糙度的标注数据远少于反照率,仅MatrixCity、InteriorVerse和ABO等少数数据集提供相关标注,这极大限制了模型对这类材质属性的泛化能力,导致预测结果易出现不一致、不可靠的问题。例如,模型几乎未接触过带有真实金属度/粗糙度标签的树木样本,因此在这类区域的预测结果模糊、可信度低(见图17)。

同时,部分反照率数据集的标签本身存在不可靠性:例如Hypersim[79]中,镜面和高光表面被赋予接近0的反照率值,而Structured3D[119]中这类表面的反照率值却被标注为不切实际的高亮度。这种标注模糊性会导致模型生成模糊的灰色调输出(见图14最后一行的窗户区域)。这是因为本模型为判别式模型,当面对不一致的监督信号时,模型会倾向于在这类区域回归至中间值,进而生成模糊的预测结果。尽管我们通过掩码剔除了反照率值低于0.01或高于0.99的像素,但模型仍可能在镜面/高光表面附近学习到偏暗或偏灰的预测模式。解决该问题的潜在方法包括:引入标注更可靠的反照率数据集,或对镜面/玻璃表面采用更一致的标注处理方式。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐