论文题目:Feature 3DGS: Supercharging 3D Gaussian Splatting to Enable Distilled Feature Fields

只是快速记录一下,阅读后脑中的思路。可能会不严谨,如果有任何错误,感谢纠正!
在这里插入图片描述

特征 3DGS 是一种新颖的三维高斯泼溅启发框架,利用2d foundation model的指导,对特征场进行提炼。
在这里插入图片描述

这里,我以clip-lseg 为例。从pipeline的右侧我们可以看到,给定一幅图像后,CLIP-LSeg 会生成language feature(语言特征)。在左侧,每个高斯都初始化一个semantic feature(语义特征) (开始时是一个低维随机变量)。这里引入了一个加速模块(speed-up module),使语言特征空间语义特征空间保持一致。该模块是一个轻量级卷积解码器。

由于我们计算的是渲染特征图(dim = N)和语言特征嵌入(dim = M)之间的损失,因此理想的条件是维度相同。然而,由2d foundation model生成的特征维度较高,导致计算开销很大。实际上,语义特征比语言特征维度要小得多。解码器通过将低维语义特征映射到高维语言特征空间来解决这个问题。这种设计可以让模型在rasterization阶段在低维空间中进行高效计算,而解码器则确保与高维空间对齐,以便在渲染后进行损失计算。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐