【视觉蒸馏】Vision-centric activation and coordination for multimodal large language models.
背景
在看论文《LingBot-VLA: A Pragmatic VLA Foundation Model》,引用了《Vision-centric activation and coordination for multimodal large language models.》
方法详解:视觉蒸馏与空间感知融合
这段文字描述了一种视觉蒸馏(Visual Distillation)方法,旨在为机器人的视觉语言模型(VLM)注入3D空间感知能力。这不仅仅是让机器人“看见”物体(RGB图像),更是让它理解物体的深度和几何结构。
以下是该方法的详细解析:
1. 核心流程:RGB与深度的对齐
该方法通过并行处理两路信息,并将它们对齐:
- RGB视觉输入( Q t \mathbf{Q}_t Qt):
模型处理三视角的RGB操作图像,通过**可学习查询(Learnable Queries)**提取出视觉特征(记为 Q t 1 , Q t 2 , Q t 3 \mathbf{Q}^1_t, \mathbf{Q}^2_t, \mathbf{Q}^3_t Qt1,Qt2,Qt3)。这些查询代表了模型对场景的“理解”。 - 深度几何输入( D t \mathbf{D}_t Dt):
同时,系统引入了来自 LingBot-Depth 的深度信息(记为 D t 1 , D t 2 , D t 3 \mathbf{D}^1_t, \mathbf{D}^2_t, \mathbf{D}^3_t Dt1,Dt2,Dt3)。
2. 关键技术:LingBot-Depth(对应搜索结果)
- 作用:根据搜索结果,LingBot-Depth 是一个将不完整、充满噪声的深度传感器数据转化为高精度、度量准确(Metric-accurate)的3D空间感知的基础模型。
- 重要性:如果没有LingBot-Depth的预处理和统一空间对齐,原始的RGB查询 Q t \mathbf{Q}_t Qt 就无法与深度的Token D t \mathbf{D}_t Dt 进行有效的数学对齐。LingBot-Depth 是这一过程中的“桥梁”。
3. 数学原理(公式 5 解读)
公式描述了如何通过“蒸馏”让模型学会看深度:
L d i s t i l l = E Q t ∥ Proj ( Q t ) − D t ∥ 1 \mathcal{L}_{distill} = \mathbb{E}_{\mathbf{Q}_t} \| \text{Proj}(\mathbf{Q}_t) - \mathbf{D}_t \|_1 Ldistill=EQt∥Proj(Qt)−Dt∥1
- Q t \mathbf{Q}_t Qt(查询向量):来自VLM的视觉特征。
- D t \mathbf{D}_t Dt(深度令牌):来自LingBot-Depth的深度特征。
- Proj ( ⋅ ) \text{Proj}(\cdot) Proj(⋅):这是一个投影层(通常使用交叉注意力机制),它的作用是将视觉特征 Q t \mathbf{Q}_t Qt 转换到与深度特征 D t \mathbf{D}_t Dt 相同的维度空间中。
- 最小化 L d i s t i l l \mathcal{L}_{distill} Ldistill:系统的目标是最小化“投影后的视觉特征”与“真实的深度特征”之间的距离(这里使用的是 L 1 L_1 L1 范数)。
简单理解:通过不断训练,让模型看到的图像特征(RGB)与实际的几何特征(深度)在数学表达上尽可能一致。
4. 最终效果
这种集成方式将几何信息(距离、形状)直接注入到 LingBot-VLA 模型中。这使得模型不再是一个只能看懂“图片”的普通AI,而是一个具备物理空间理解能力的具身智能体,从而能更稳健地执行复杂的机械臂操作任务。
文章目录
摘要
多模态大语言模型(MLLMs)通过将视觉编码器的图像特征与大语言模型(LLMs)结合,展示了先进的理解能力。然而,主流的MLLMs仅通过文本标记的下一个标记预测进行监督,忽略了对分析能力至关重要的视觉中心信息。为了解决这一困境,我们引入了VaCo,它通过来自多个视觉基础模型(VFMs)的视觉中心激活和协调来优化MLLM表示。VaCo引入了视觉区分对齐,以整合从VFMs中提取的任务感知感知特征,从而统一优化MLLM中的文本和视觉输出。具体来说,我们将可学习的模块化任务查询(MTQs)和视觉对齐层(VALs)融入MLLMs,在多种VFMs的监督下激活特定的视觉信号。为了协调不同VFMs之间的表示冲突,精心设计的令牌网关掩码(TGM)限制了多个MTQ组之间的信息流动。广泛的实验表明,VaCo显著提高了不同MLLMs在各种基准测试中的性能,展示了其在视觉理解方面的卓越能力。
1.introduce
我们提出了 VaCo,一种针对多模态大语言模型(MLLMs)的微调方法,该方法利用现有视觉基础模型(VFMs)中的以视觉为中心的激活与协同机制,从而提升 MLLMs 的视觉理解能力,如图 1(a) 所示。

两个阶段的文本损失可视化。我们研究视觉信号激活对文本输出的影响:(a)在预训练(PT)阶段,VaCo 中引入纯视觉模型使得初始对齐变得复杂,但损失收敛趋势与其他方法相似;(b)在监督微调(SFT)阶段,VaCo 的文本损失以更快速度收敛至更低值,表明基于查询的视觉激活与协调机制有效促进了多模态大语言模型(MLLM)对全面视觉信息的获取。
总之,我们的主要贡献如下:
- (i) 我们强调了视觉监督在多模态大语言模型(MLLMs)中的关键作用,指出在集成多个视觉基础模型(VFMs)时,基于查询的判别性对齐目标比生成性目标更有效;
- (ii) 我们提出了可学习的模块化任务查询(Modular Task Queries, MTQs)和视觉对齐层(Visual Alignment Layers, VALs),以通过不同 VFMs 激活 MLLMs 中的感知线索,并辅以令牌门控掩码(Token Gateway Mask, TGM)在因果架构内协调任务感知表征。
- (iii) 我们在多种视觉-语言基准上进行了广泛的实验,涵盖通用、区域级和场景级任务,这些实验凸显了所提出的 VaCo 在跨模态理解方面的优越性。
1.1 判别性对齐
“基于查询的判别性对齐目标”通常出现在跨模态检索、视觉-语言对齐或多模态学习的研究中(比如图像-文本匹配、视觉问答、图文预训练等)。我们可以把它拆开来理解:
1.1.1. 基于查询(Query-based)
- 存在一个查询(query),可以是文本描述、问题、或者某一段自然语言。
- 模型需要根据这个查询,从另一模态(如图像、视频、知识库)中找到或对齐到相关内容。
- 例如:
- 文本查询:“一只狗在草地上奔跑” → 在图像集合中检索对应图片
- 问题查询:“图中有几辆车?” → 在图像区域中定位并理解相关内容
1.1.2. 对齐(Alignment)
- 指的是不同模态之间的对应关系学习,例如:
- 文本和图像的全局特征对齐
- 文本中的词与图像中的区域(region / patch)对齐
- 对齐通常是通过学习一个共享的嵌入空间,使得相关的跨模态样本距离更近,不相关的更远。
1.1.3. 判别性(Discriminative)
- 强调模型不仅要“对齐”,还要能区分正负样本。
- 常见做法是使用对比学习(Contrastive Learning)或三元组损失(Triplet Loss):
- 正样本:查询与其对应的目标(如配对的图像/文本)
- 负样本:查询与不相关的目标
- 目标函数会拉进正样本对的距离,推开负样本对的距离,从而学习具有判别能力的表示。
1.1.4综合理解:
“基于查询的判别性对齐目标” 指的是:
在给定的查询(如一句话或问题)下,设计一种目标函数,使得模型能够将查询与正确的目标模态内容(如对应图像或文本)在特征空间中对齐,同时拉开与错误内容的差异,从而实现有区分度的跨模态匹配。
1.1.5举个例子(图像-文本检索):
- Query:一句话描述
- 正样本:与之匹配的图像
- 负样本:不匹配的图像
- 目标:学习一个相似度函数 ( S(q, v) ),使得
S ( q , v + ) > S ( q , v − ) + margin S(q, v^+) > S(q, v^-) + \text{margin} S(q,v+)>S(q,v−)+margin
这就是一种“基于查询的判别性对齐”。
2 PRELIMINARY
大型语言模型(Large Language Models, LLMs)的学术文献,具体指向了由 Alec Radford 等人(OpenAI 团队)在 2018 年和 2019 年发表的工作(如 GPT-1 和 GPT-2)。
它们证明了通过“预训练”(在大量无标签文本上学习)加“微调”或“提示”(Prompting),模型可以执行多种复杂的语言任务。后续所有主流 LLM(包括 GPT-3, GPT-4, LLaMA 等)的基础。
模型内部包含大量的数字,这些数字被称为“参数”(Parameters),统称为 θ(希腊字母 Theta)。
通俗解释:你可以把 θ 想象成大脑中的“神经连接强度”。当你训练一个模型时,实际上就是在调整这数十亿甚至数万亿个 θ 的值,使其能够准确地预测下一个词。
作用:θ 存储了模型从数据中学到的所有知识(语法、事实、逻辑模式)。
大型语言模型(特别是 GPT 系列)的核心机制:它是一个通过大量参数 θ \theta θ 定义的概率系统,该系统以单向(因果)的方式,根据历史文本上下文,逐步预测下一个文本 token 的出现概率。 理解这一点,就理解了现代生成式 AI 是如何“说话”的。
2.1 因果分布
“model the canonical causal distribution” (建模典型因果分布)
关键词:“Causal”(因果/单向):这是最关键的概念。在语言模型中,“因果”并不意味着哲学上的因果关系,而是指时间上的先后顺序或生成时的方向性。
解释:模型只能看到过去的词,不能看到未来的词。它基于前面已经出现的单词来预测下一个单词。这与“双向模型”(如 BERT,它同时看左边和右边的词来进行填充)形成对比。
关键词:“Canonical distribution”(典型分布/标准分布):指这是一种标准的概率分布,用来描述文本出现的可能性。
2.2 长度为 T 的文本 token 序列
Tokens(词元):计算机不直接理解“单词”,而是将文本切分成小块,称为 token。
例子:句子 “I love coding” 可能被切分为 [“I”, " love", " coding"]。每个 token 对应一个数字 ID。
Sequence x1,x2,…,xT :表示一个按顺序排列的 token 列表。
Length T :序列的总长度,即有多少个 token。
2.3 数学公式: p θ ( x ) = ∏ t = 1 T p θ ( x t ∣ x < t ) p_\theta(x) = \prod_{t=1}^{T} p_\theta(x_t | x_{<t}) pθ(x)=∏t=1Tpθ(xt∣x<t)
这是整段文字最核心的技术定义。让我们把它翻译成人类语言:
- p θ ( x ) p_\theta(x) pθ(x):这是模型认为整个序列 x x x 出现的概率。
- ∏ \prod ∏ (连乘符号):表示将一系列概率相乘。
- p θ ( x t ∣ x < t ) p_\theta(x_t | x_{<t}) pθ(xt∣x<t):这是条件概率。
- x t x_t xt:当前要预测的第 t t t 个 token。
- x < t x_{<t} x<t:第 t t t 个 token 之前出现的所有 token(即上下文)。
- 含义:模型计算的是“在已知前 t − 1 t-1 t−1 个词的情况下,第 t t t 个词是 x t x_t xt 的概率”。
直观类比:
想象你在玩一个填空游戏,句子是:“今天天气真___。”
- 模型看到前文:“今天天气真” ( x < t x_{<t} x<t)。
- 模型根据参数 θ \theta θ 计算出下一个词是“好”的概率是 0.8,是“坏”的概率是 0.1,是“晴”的概率是 0.05。
- 如果模型最终选择了“好”,那么它计算的就是 P ( "好" ∣ "今天天气真" ) P(\text{"好"} | \text{"今天天气真"}) P("好"∣"今天天气真")。
- 对于整段话,模型就是把每一步预测的概率乘起来,得到整段话生成的总体可能性。
implications
-
生成式 AI 的基石:
这段公式定义了所有文本生成模型的基本运作逻辑。无论是写代码、写小说、还是回答问题,底层原理都是不断计算 p θ ( x t ∣ x < t ) p_\theta(x_t | x_{<t}) pθ(xt∣x<t)。 -
概率 vs. 确定性:
模型输出的不是唯一的“正确答案”,而是一个概率分布。这意味着模型具有“创造性”或“随机性”。通过调整采样参数(如 Temperature),我们可以让模型变得更严谨(选择概率最高的词)或更富有想象力(选择概率较低但有趣的词)。 -
上下文窗口(Context Window)的限制:
公式中 x < t x_{<t} x<t 表明,预测依赖于历史。在硬件有限的情况下,模型能记住的“历史”长度 T T T 是有限的。这是当前 LLM 面临的主要技术挑战之一(如何高效处理长序列)。 -
预训练的目标:
训练这些模型的目标,就是找到一组完美的 θ \theta θ,使得真实人类文本的序列 x x x 的概率 p θ ( x ) p_\theta(x) pθ(x) 最大化。
2.4 为什么强调“因果”(Causal)?
在深度学习中,区分**自回归(Autoregressive/Causal)和掩码(Masked/Bidirectional)**至关重要:
- 自回归(本文所述):像写文章一样,从第一个字写到最后一个字。生成式 AI(如 ChatGPT)都属于此类。它必须保证逻辑连贯,不能“剧透”后面会说什么。
- 掩码(如 BERT):像做阅读理解填空,可以同时看到整段话来推断某个缺失的词。它不适合生成连续的长文本,因为生成时需要循环多次,效率低且容易产生逻辑矛盾。
参数 θ \theta θ 是如何工作的?
θ \theta θ 通常是一个巨大的神经网络(主要是 Transformer Decoder 架构)。
- 输入:之前的 token。
- 处理:通过多层注意力机制(Attention), θ \theta θ 会评估之前出现的每个词对当前预测的影响权重。
- 输出:下一个 token 的概率分布。
- 训练过程:通过随机梯度下降(SGD)等优化算法,不断微调 θ \theta θ,使得预测出的概率分布尽可能接近真实人类书写的文本分布。
2.5. 常见疑问解答 (FAQ)
Q1: 既然模型只预测下一个词,它是如何理解复杂逻辑和长距离依赖的?
A: 这得益于 Transformer 架构中的自注意力机制(Self-Attention)。尽管公式看起来是逐步预测的,但在计算每一个 p θ ( x t ∣ x < t ) p_\theta(x_t | x_{<t}) pθ(xt∣x<t) 时,模型可以通过注意力机制“回头”查看序列中早期出现的、与当前词相关的关键信息。例如,在预测句尾的动词时,模型可以注意到句首的主语,从而保持语法一致。
Q2: 公式中的连乘 ∏ \prod ∏ 会导致数值下溢(Underflow)怎么办?
A: 在实际工程实现中,直接使用连乘会导致数字极小,计算机无法处理。因此,通常转换为**对数概率(Log-Probability)**的形式,将连乘变为连加:
log p θ ( x ) = ∑ t = 1 T log p θ ( x t ∣ x < t ) \log p_\theta(x) = \sum_{t=1}^{T} \log p_\theta(x_t | x_{<t}) logpθ(x)=t=1∑Tlogpθ(xt∣x<t)
这样既保持了数学等价性,又提高了数值稳定性。
Q3: 这个公式是 GPT 特有的吗?
A: 这个公式描述的是所有自回归语言模型的共同数学本质。虽然 Radford 等人(GPT 系列)使其流行,但类似的因果模型也用于其他架构(如 LLaMA, PaLM, Gemini 等)。不同模型的区别在于网络结构的具体设计、参数量大小以及训练数据的质量。
2.6 多模态
传统的大语言模型(LLM,如早期的 GPT-3)只能处理文本,无法“看”图片。而多模态大语言模型(MLLM,如 GPT-4V、Qwen-VL、LLaVA)则具备图文理解能力。
要实现这一点,关键在于解决一个核心问题:**语言模型只懂向量化的文本,不懂像素组成的图像。**因此,我们需要一个中间桥梁,把图像变成语言模型能懂的“ tokens ”(标记/词元)。这段文本正是描述这个桥梁是如何构建和训练的。
为实现有效的多模态理解,多模态大语言模型(MLLMs)Liu 等(2023a)将原始文本 token 与长度为 K 的视觉 token 序列 { v i } k = 1 K \{v_i\}_{k=1}^K {vi}k=1K 扩展后,作为大语言模型(LLM)的输入序列。
获取这些视觉 token 的典型方法是通过参数为 ζ \zeta ζ 的视觉编码器 E ζ E_\zeta Eζ对图像 I I I 进行 patch embedding 处理。
- (例如 CLIP Radford 等(2021)和 SigLIP Zhai 等(2023)这两者是当前最先进的视觉编码器,擅长理解图像内容并与文字对齐。)
随后,采用参数为 ϕ \phi ϕ 的多模态投影器 P ϕ P_\phi Pϕ 将这些视觉 token 映射到大语言模型的特征空间。
- 视觉编码器输出的“视觉 tokens”是在视觉特征空间里的,而大语言模型(LLM)需要的是在文本特征空间里的向量。这两者坐标系不同,不能直接相加。
- ϕ 通常是一个轻量级的神经网络(如 MLP 多层感知机),它的训练成本远低于训练整个大模型。
2.6.1 视觉 Tokens 的定义
- 原文:
v = Pϕ ◦ Eζ (I) - 解释:
- 这里的 v v v 代表最终的“视觉 tokens”。
- E ζ ( I ) E_\zeta(I) Eζ(I) 表示先用编码器处理图像 I I I。
- P ϕ P_\phi Pϕ 表示接着用投射器处理编码器的输出。
- ∘ \circ ∘ 代表函数复合,即先做前面的事,再做后面的事。
2.6.2 数学公式解读:最大似然估计 (MLE)
文本给出了 MLLM 的损失函数(Objective Function):
L M L L M ( Θ = { θ , ϕ } , x , I ) = − E t [ ∑ t = 1 T log p θ ( x t ∣ x < t , v ) ] \mathcal{L}_{MLLM}(\Theta = \{\theta, \phi\}, x, I) = -E_t \left[ \sum_{t=1}^{T} \log p_\theta (x_t | x_{<t}, v) \right] LMLLM(Θ={θ,ϕ},x,I)=−Et[t=1∑Tlogpθ(xt∣x<t,v)]
让我们逐层解析这个公式的含义:
-
Θ = { θ , ϕ } \Theta = \{\theta, \phi\} Θ={θ,ϕ}:
- 这是模型需要优化的所有参数。
- θ \theta θ:大语言模型(LLM)本身的参数。
- ϕ \phi ϕ:多模态投射器的参数。
- 注意:这里没有包含视觉编码器 E ζ E_\zeta Eζ 的参数 ζ \zeta ζ,暗示在后续阶段视觉编码器可能是冻结的(Freezed)。
-
x x x 和 I I I:
- x x x:输入的文本序列(例如问题或指令)。
- I I I:输入的图像。
-
p θ ( x t ∣ x < t , v ) p_\theta (x_t | x_{<t}, v) pθ(xt∣x<t,v):
- 这是模型在时间步 t t t 预测下一个词 x t x_t xt 的概率。
- 条件包括:之前生成的文本 x < t x_{<t} x<t 和 视觉信息 v v v。
- 这意味着,模型在生成每一个字时,都会参考图像的内容。
-
− log -\log −log 和 Sum:
- 这是标准的**交叉熵损失(Cross-Entropy Loss)**形式。
- 目标是让模型预测真实下一个词的概率最大化(因为前面有负号,最小化损失等价于最大化对数似然)。
-
E t E_t Et:
- 表示对训练数据中的各个时间步或样本求期望(平均)。
简单来说:这个公式告诉模型,“给你一张图和一个问题,你要尽力猜出正确的回答。如果猜对了,奖励;猜错了,惩罚。”
2.6.3. 训练流程:两个阶段
文本最后提到,MLLM 的优化通常分为两个阶段:
-
第一阶段:投射器的预训练 (Pre-training of the projector)
- 目的:搭建桥梁。
- 操作:冻结(固定)大语言模型和视觉编码器的参数,只训练投射器 P ϕ P_\phi Pϕ。
- 方法:通常使用大规模图文对数据,让投射器学会把图像特征“翻译”成大模型能懂的格式。
-
第二阶段:指令微调 (Instruction Tuning)
- 目的:提升交互能力。
- 操作:解冻(更新)大语言模型 θ \theta θ 和投射器 ϕ \phi ϕ 的参数。
- 方法:使用指令微调数据集(例如:“请描述这张图片” -> “这是一只猫”),让模型学会如何根据用户的具体指令来回答问题,而不仅仅是生成文本。
2.6.4.意义 (Significance)
- 解耦设计:这种“编码器-投射器-LLM”的架构是目前 MLLM 的主流范式(如 LLaVA 系列)。它的优势在于可以复用强大的现成 LLM(如 Llama, Qwen)和视觉编码器(如 CLIP, SigLIP),只需训练一个小而快的投射器,极大地降低了训练成本和算力需求。
- 标准化接口:投射器为不同的视觉模型和大语言模型之间提供了标准的接口,促进了生态系统的兼容性。
2.6.5. 潜在问题
- 为什么公式里没有 ζ \zeta ζ(视觉编码器参数)?
- 这通常意味着在预训练投射器时,视觉编码器是冻结 (Frozen) 的。这样做是因为视觉编码器通常已经在大规模数据集上预训练得很好,且参数量巨大,更新它非常昂贵且没有必要。
- 投射器会不会丢失信息?
- 是的,投射器通常是一个简单的线性层或小型 MLP,可能会有信息瓶颈。研究者一直在探索更复杂的连接器(如 Q-Former, BLIP-2 中的 cross-attention 模块)来解决这个问题。
- CLIP 和 SigLIP 有什么区别?
- 两者都是优秀的视觉编码器。CLIP 通过对比学习训练,SigLIP 改进了损失函数,通常在内部检索任务上表现更好,但作为 MLLM 的视觉底座,两者常被互换使用。
2.6.6.总结
这段文本精确定义了多模态大模型如何将“图像”转化为“语言模型可理解的信号”,并给出了其数学优化目标。它揭示了当前 MLLM 技术栈的核心:利用强大的视觉编码器提取特征,通过可训练的投射器进行模态对齐,最后由冻结或微调的大语言模型进行逻辑推理和生成。
3 METHODOLOGY
本文介绍了一种名为 VaCo 的新型技术方法,旨在优化多模态大语言模型(MLLMs)的视觉理解能力。
3.1.1. 背景与核心概念解析
在深入 VaCo 之前,我们需要先理解文中提到的几个关键术语:
-
MLLMs (Multimodal Large Language Models,多模态大语言模型):
- 这是当前人工智能的前沿领域,指的是既能处理文本也能处理图像(或其他模态)的大模型。例如,你可以给它看一张猫的照片,它不仅能认出是猫,还能写出关于猫的描述或回答关于猫的问题。
- 挑战:虽然这些模型很强,但在处理复杂的视觉任务时,往往无法充分利用图像中的细微特征或特定领域的先验知识。
-
VFMs (Vision Foundation Models,视觉基础模型):
- 指专门用于视觉任务的大型预训练模型,如 CLIP、ViT 等。它们拥有强大的“视觉先验”(Visual Priors),即对物体、纹理、形状等的基本认知能力。
- 作用:VaCo 的目的就是“借用”这些 VFMs 的强大能力来增强 MLLMs 的视觉理解力。
-
视觉先验 (Visual Priors):
- 指模型在预训练过程中积累的关于视觉世界的常识性知识。例如,知道“天空通常在上方”,“车轮是圆形的”等。VaCo 试图激活这些沉睡的知识。
3.1.2. VaCo 方法的核心组成部分
文本指出 VaCo 包含两个关键组件,我们可以将其比喻为一个翻译与协调团队:
组件一:以视觉为中心的激活 (Vision-Centric Activation)
- 目标:让 MLLM 能够调用 VFMs 中特定的视觉知识。
- 关键工具 1:模块化任务查询 (MTQs, Modular Task Queries)
- 解释:你可以把 MTQs 想象成不同的“搜索关键词”或“指令”。比如,当任务需要识别物体形状时,调用一个 MTQ;当需要识别场景氛围时,调用另一个 MTQ。
- 作用:它们负责指向 MLLM 内部特定的视觉特征。
原文关键句:
“Formally, we define a set of learnable modular task queries, denoted by q t a s k = { q i } i = 1 Q q_{task} = \{q_i\}_{i=1}^Q qtask={qi}i=1Q, each with a length of Q… Then the input sequences of MLLM can be denoted as { v , q , x } \{v, q, x\} {v,q,x}. To direct these queries towards specific visual tasks, we present the visual alignment layer below.”
形式化解释:
-
q t a s k q_{task} qtask (任务查询): 这是一个包含 Q Q Q 个向量的集合。下标
task表示这个查询集合是专门为某个视觉任务(例如“深度估计”)设计的。这些向量是可训练的,意味着模型可以通过学习调整这些查询,使其更有效地提取信息。 -
输入序列 { v , q , x } \{v, q, x\} {v,q,x}:
- v v v: 原始的视觉特征 (Visual features)。
- q q q: 任务查询 (Task queries)。
- x x x: 文本输入 (Text tokens)。
- 这意味着模型在处理时,会同时考虑图像特征、特定的任务查询指令以及文本内容。
-
视觉对齐层 (Visual Alignment Layer):
- 为了让这些查询能够准确地指向特定的视觉任务,作者提出引入一个“视觉对齐层”。这个层的作用可能是将不同来源的视觉特征(来自不同VFMs)与任务查询 q q q 进行匹配和对齐,确保查询能触发正确的视觉响应。
-
关键工具 2:视觉对齐层 (VALs, Visual Alignment Layers)
- 解释:这是一个转换器或桥梁。因为 VFMs 和 MLLM 的“语言”不同(数据格式或特征空间不一致),VAL 负责将 MTQs 转换到不同的“任务感知空间”。
- 类比:如果 VFMs 说的是“法语”,MLLM 说的是“中文”,VAL 就是一个实时翻译器,确保 MTQs 发出的指令能被 MLLM 准确理解,并利用 discriminative objectives(判别性目标,即一种训练策略)来优化这种转换。
具体而言,针对特定任务的VAL由一组可学习的视觉对齐查询(Visual Alignment Queries, VAQs) q val ∈ R M × D q_{\text{val}} \in \mathbb{R}^{M \times D} qval∈RM×D 组成,这些查询初始化为随机值,其长度 M M M 和维度 D D D 与特定视觉模型中的图像token保持一致。
给定由多模态大语言模型(MLLM)和线性层输出的模块化任务查询 q task ∈ R Q × D q_{\text{task}} \in \mathbb{R}^{Q \times D} qtask∈RQ×D,VAL利用若干Transformer块(Vaswani等,2017)将其转换为任务感知的视觉模型的特征空间。
交叉注意力机制将VAQ作为查询,并将多模态任务查询(MTQs)作为键和值。这一设计不仅提取出独立于语言指令的富有信息的视觉表示,而且内在激活了MLLM表征中的视觉感知能力。这是因为具有因果结构的多模态大语言模型在与MTQs结合时,会在提供最终答案之前优先生成特定任务的视觉特征。
在实践中,一旦获得由参数为 ξ \xi ξ 的视觉对齐层(VAL)输出的、与特定视觉基础模型(VFM)在维度上兼容的输出查询 q q q,我们就采用均方误差(MSE)和对比目标(即 InfoNCE He 等,2020)来实现视觉对齐查询(VAQ)与 VFM 特征 F ( I ) F(I) F(I) 之间的对齐。
其中, F F F 表示预训练的视觉基础模型(VFM),其在微调过程中保持冻结; B B B 表示样本数量; λ = 0.1 \lambda = 0.1 λ=0.1 为平衡因子; τ \tau τ 表示对比项的可学习缩放因子。通过对该目标函数进行优化,并结合多目标查询(MTQs)与视觉自适应查询(VAQs)之间的协同作用,我们在无需进行文本-视觉对齐的情况下,通过间接引入纯视觉模型中的专家知识,激活了多模态大语言模型(MLLM)现有的视觉表征。与现有的多编码器方法(Tong 等,2024a;Jain 等,2024)相比,我们的方法在推理阶段仅依赖 MTQs,无需额外的视觉编码器。因此,VaCo 在显著降低计算成本的同时(见附录表 8),高效地利用了多样化的视觉线索。
组件二:以视觉为中心的协调 (Vision-Centric Coordination)
- 目标:防止不同视觉特征之间的混乱和冲突。
- 关键工具:令牌网关掩码 (TGM, Token Gateway Mask)
- 解释:当 MLLM 同时处理多个不同的视觉任务或特征组时,信息可能会互相干扰(例如,形状信息干扰了颜色信息的判断)。TGM 就像是一个“交通警察”或“过滤器”。
- 作用它限制信息流,确保来自不同 VFMs 的特定任务信息保持独立,防止“表征冲突”(Representation Conflicts)。这意味着,处理“形状”的信息不会错误地影响处理“纹理”的信息。

Token Gateway Mask(TGM)。尽管我们的 VaCo 为不同的视觉任务采用了不同的 VAL,但任务特定的 MTQ 仍持续参与在多模态大语言模型(MLLM)的因果注意力机制中的交互。如表 4(b) 所示,各个任务的不同目标导致在处理过程中,由因果 MLLM 处理的任务查询之间出现了表征冲突(Metz 等,2020;Vandenhende 等,2021),从而造成性能显著下降。例如,深度估计任务强调全局对象层级结构(Ranftl 等,2021),而分割任务则聚焦于局部几何形状(Chen 等,2018)。受近期工作的启发(Xie 等,2024),我们基于 MLLM 的因果解码器单一架构,设计了一种 Token Gateway Mask(TGM)来限制多组 MTQ 之间的信息流动,如图 4 所示。该技术确保在因果处理过程中,不同的 MTQ 彼此不可见,仅允许其与图像 token 进行交互。结合每个任务的独立查询,TGM 缓解了不同视觉任务之间潜在的表征冲突。这种机制协调了多个视觉基础模型(VFMs),并在 MLLM 中模块化地激活特定的视觉先验。
3.1.3. 整体运作流程(图解逻辑)
VaCo 的工作流程大致如下:
- 输入:图像数据进入系统。
- 激活:MTQs 被生成,用于询问 VFMs 特定的视觉信息(如:“告诉我这个物体的边缘特征”)。
- 对齐:VALs 将这些询问转化为 MLLM 能理解的格式,并激活 MLLM 中对应的视觉模块。
- 协调:TGM 介入,确保不同视觉模块之间产生的信息不互相打架,保持清晰独立。
- 输出:MLLM 结合处理好的视觉信息和文本指令,生成最终的准确回答或描述。

3.1.4. 意义与影响
- 提升视觉理解力:通过“Harnessing visual priors”(利用视觉先验),VaCo 能让通用的多模态模型变得更加专业,特别是在需要精细视觉分辨力的任务上。
- 解决信息冲突:在多模态融合中,最大的难题之一是模态间的信息冲突(例如文本说“红色”,图片显示“蓝色”)。TGM 的设计直接针对这一问题,提高了模型的鲁棒性。
- 模块化设计:VaCo 的模块化特性使其具有灵活性。研究人员可以轻松添加新的 VFMs 或任务查询,而不需要重新训练整个庞大的 MLLM 模型,这降低了计算成本和开发难度。
3.1.5. 潜在疑问与补充说明
- Q: 为什么需要专门的“对齐层” (VAL)?
- A: 因为不同的视觉基础模型(如 CLIP 和 ViT)提取特征的方式和维度完全不同。如果没有 VAL,MLLM 就无法直接整合这些异构的视觉信息。
- Q: “表征冲突”具体指什么?
- A: 想象你在同时听两个人说话,如果他们的信息混杂在一起,你会听不清。在多模态模型中,如果表示“形状”的神经元信号和表示“颜色”的信号相互干扰,模型就可能产生幻觉或错误判断。TGM 就是用来隔离这些信号的。
- Q: VaCo 是训练一个新模型吗?
- A: 从文中“tuning MLLMs”(微调 MLLMs)来看,VaCo 更像是一种微调策略或插件架构。它不需要从头训练 MLLM,而是通过在现有模型上添加 VAL 和 TGM 模块,并引入 MTQs 来增强其能力。这通常比从头训练更高效。
3.1.6总结
VaCo 是一种创新的微调方法,它通过设计特殊的查询机制 (MTQs) 和对齐层 (VALs) 来激活多模态模型中的视觉知识,并引入网关掩码 (TGM) 来管理这些知识,防止信息混乱。其核心目标是让多模态大语言模型不仅“能看”,而且能“看懂细节”,从而显著提升其在复杂视觉任务中的表现。
视觉特征模型(VFMs)
得益于丰富的社区资源,我们选择了几个任务感知的 VFMs,即 Depth Anything V2 、OneFormer 以及 VGGT ,同时搭配一种自监督方案,即 DINOv2 )。做出这些选择的原因在于,这些模型共同覆盖了视觉理解的核心维度,即深度、语义、几何结构和泛化能力。尽管如此,VaCo 还兼容基于 Vision Transformer(ViT)架构 的额外视觉模型。
3.3 OPTIMIZATION OBJECTIVE
基于多模态查询(MTQs)、多模态大语言模型(MLLMs)生成的文本响应以及视觉基础模型(VFMs)提供的以视觉为中心的目标,我们遵循两阶段训练策略 Liu et al. (2023a),即预训练(PT)阶段和监督微调(SFT)阶段,对图像投影器、MTQs、视觉对齐层(VAL)以及大语言模型(LLM)进行微调。
6 CONCLUSION
在本研究中,我们通过强调整合关键视觉中心信息以增强分析能力, addressing 当前多模态大语言模型(MLLMs)的局限性。我们框架的创新之处在于通过视觉中心激活与协调(VaCo)对文本和视觉输出进行监督,从多个视觉基础模型(VFMs)中提取全面的视觉先验。通过统一的框架,VaCo 管理视觉中心表示的激活,专注于特定维度以提升视觉理解能力。这一目标通过学习模块任务查询(MTQs)、视觉对齐层(VALs)以及 Token 网关掩码(TGM)来实现,促进了视觉 Token 与多个 VFMs 之间的有效交互。广泛的实验表明,我们的 VaCo 方法在多种基准测试中显著提升了 MLLM 的性能,涵盖了通用、区域级和场景级理解任务,展现了其先进的视觉理解能力。
更多推荐

所有评论(0)