近年来,在处理高分辨率图像时,主流的大型多模态模型(LMM)通常将图像划分为多个局部图像和一个全局图像,这会导致产生大量视觉 token。在本研究中,我们提出了 AVG-LLAVA,这是一种能够根据输入图像和指令自适应选择合适视觉粒度的 LMM。这种方法不仅能减少视觉 token 的数量、加速推理过程,同时还能提升整体模型性能。

具体来说,我们基于 LLaVA-NeXT 引入了以下模块:

  • (a) 视觉粒度缩放器(visual granularity scaler):包含多个池化层,用于提取不同粒度的视觉 token;

  • (b) 视觉粒度路由器(visual granularity router):由 Transformer 层、MLP 层和投票层组成,用于根据图像和指令选择最合适的视觉粒度。

此外,我们还提出了一种新颖的训练范式 RGLF,它的目标是将路由器预测的粒度与 LMM 模型的偏好对齐,无需额外的人工标注数据。

大量实验与分析表明,AVG-LLAVA 在 11 个基准测试上都取得了优越的性能,同时大幅减少了视觉 token 数量并显著加快了推理速度(例如:在 AI2D 基准上视觉 token 数量减少了 85.3%,推理速度提升了 2.53 倍)。

项目代码将开放于:
👉 https://github.com/DeepLearnXMU/AVG-LLaVA

1 Intro

近年来,人工智能(AI)领域在大型多模态模型(LMMs)方面取得了显著进展(OpenAI, 2023b;Zhu 等,2023;Dai 等,2023;Liu 等,2023a, 2024a),标志着朝着人工通用智能(AGI)迈出了坚实的一步。大多数现有的 LMMs 遵循 LLaVA 的结构(Liu 等,2023a;2024a),其包括一个视觉编码器,用于将图像嵌入为视觉 token,并通过连接器将其映射到词嵌入空间中。随后,这些视觉 token 被输入到大型语言模型(LLM)中(Touvron 等,2023;OpenAI, 2023a;Chiang 等,2023),用于实现多模态理解和推理,与词嵌入一起工作。

由于视觉编码器(例如 CLIP-ViT)采用固定的长宽比(如1:1)和低分辨率(如336×336),因此早期的LMM在处理不同长宽比的高分辨率图像时面临挑战。为应对这一限制,LLaVA-NeXT(Liu 等,2024b)等主流模型会将每张高分辨率图像动态划分为多个局部图像。这些局部图像会被分别编码,并将其 token 与原始全图像的 token 拼接。这种方式会导致视觉 token 序列变长,例如672×672图像会产生2880个token。然而,在实际应用中,这种细粒度的视觉信息并不总是必要的。在某些任务中,粗粒度的信息甚至更有利于模型预测。例如,要识别运动员球衣上的号码需要较精细的视觉信息,而判断颜色只需粗粒度信息。

本文中,我们提出了一种自适应视觉粒度模型 —— Adaptive Visual Granularity LLaVA(AVG-LLaVA)。它能够根据输入图像和指令,自适应选择合适的视觉粒度。这种方式不仅减少了视觉 token 的数量,加快了推理速度,还提升了整体模型性能。具体地说,AVG-LLaVA 在 LLaVA-NeXT 的基础上,引入了以下两个模块:

  • 视觉粒度缩放器(visual granularity scaler):不经训练地进行多轮池化,每轮将视觉 token 的数量减半,从而得到一系列不同粒度的视觉特征。

  • 视觉粒度路由器(visual granularity router):包括一个 Transformer 层、一个 MLP 层和一个 voting 层,根据图像和文本输入,选择最适合的粒度。

通过上述机制,对于不需要精细信息的任务,AVG-LLaVA 能够自动选择粗粒度特征,不仅减少了 token 数量、提高了推理效率,还增强了模型效果。

此外,我们观察到仅依赖视觉指令微调来训练粒度路由器是具有挑战性的,因为模型难以分辨不同粒度对性能的影响。因此,我们提出了一种新的训练范式 Ranking Granularity via LMM Feedback(RGLF)。该方法将路由器预测的不同粒度概率,与大型多模态模型偏好对齐,不需要人工标签。该方法采用排名损失函数(HadSELL 等,2006;Hopkins & May, 2011;Liu 等,2022),有效提升了粒度区分与选择能力。

在11个基准测试上的实验结果表明,AVG-LLaVA 在保持性能的同时,可将视觉 token 数量减少 85.3%,在 AI2D 基准上推理速度提升达 2.53 倍。

以下是你提供的两页“相关工作”部分的完整中文翻译:


2 相关工作

大型多模态模型(Large Multimodal Models)

GPT-4(OpenAI, 2023a)、LLaMA(Touvron et al., 2023)和 Gemini(Team et al., 2023)等大型语言模型(LLMs)在语言理解和生成方面取得了显著成功。受此推动,多模态大型模型(LMMs)因其广泛的应用而受到关注。例如,Flamingo(Alayrac et al., 2022)、BLIP-2(Li et al., 2023b)和 LLaMA-adapter(Zhang et al., 2023)通过集成冻结的视觉编码器和可训练模块到 LLM 中,将其扩展为 LMMs。这些模型通过普通的图文对数据进行微调,使它们能够处理和理解视觉内容。

为了进一步提升模型的指令跟随能力和响应质量,LLaVA(Liu et al., 2023a)使用 GPT-4 生成的视觉指令数据对整个模型进行微调。然而,这些模型依赖 CLIP-ViT 来处理固定分辨率(如 336×336)的图像,从而限制了其在高分辨率图像中的表现能力。


高分辨率 LMMs(High-Resolution LMMs)

为了感知更高分辨率的图像,Qwen-VL(Bai et al., 2023)将输入图像分辨率提升到 448×448,并引入了额外的训练阶段。在这方面,Vary(Wei et al., 2023)和 Mini-Gemini(Li et al., 2024a)均采用了双视觉编码器架构:一个是新增的高分辨率视觉编码器,另一个是原本的低分辨率编码器。

不同于上述方法,SPHINX(Lin et al., 2023)和 Monkey(Li et al., 2024b)将输入图像放大至高分辨率后,划分为固定数量的局部图像,这些局部图像分别使用图像编码器进行处理以提取局部图像 token,随后再与全局图像 token 拼接后输入 LLM。同时,LLaVA-NeXT(Liu et al., 2024b)采用多种分辨率,并自适应选择最匹配输入图像的分辨率。

尽管这些方法能提升性能,但也显著增加了视觉 token 的数量,因为计算复杂度通常随着 token 数量的平方级增长,进而导致更高的推理成本。


LMM 的视觉 token 减少策略(Vision Token Reduction for LMMs)

近年来,出现了多种方法用于减少 LMM 的视觉 token 数量,主要包括视觉 token 的剪枝与合并。例如,CrossGET(Shi et al., 2023)引入一种跨模态 token,用于利用跨模态信息决定哪些 token 应被选择或合并。

LLaVA-PruMerge(Shang et al., 2024)通过计算类 token 与其他 token 的相似度来确定哪些视觉 token 应被剪枝或合并。

不同于上述方法,FastV(Chen et al., 2024b)发现大多数图像 token 在第二个解码层后几乎未被注意到,因此直接剪去一半图像 token。VTW(Lin et al., 2024b)则更为激进,直接在某层剪去所有视觉 token。

然而,尽管这些方法能有效减少视觉 token 的数量,但往往会导致模型性能的下降。

近期,LLaVA-M³(Cai et al., 2024)通过池化方式提取多粒度视觉特征,并根据图像与指令自适应选择适当粒度的视觉 token,从而实现推理速度与性能的良好平衡。

与上述方法不同,我们的模型能根据输入内容自适应选择适当的视觉粒度,不仅减少视觉 token,还能提升模型性能。

3 方法

3.1 模型架构

如图 2 所示,除了视觉编码器、视觉-语言连接器和 LLM 之外,AVG-LLaVA 在 LLaVA-NeXT 的基础上引入了两个额外模块:视觉粒度缩放器(Visual Granularity Scaler)和视觉粒度路由器(Visual Granularity Router)。以下将详细介绍这些关键组件。

3.2 多阶段训练

为了有效地训练我们的模型,我们精心设计了一个多阶段训练策略,包括四个阶段,如图3所示。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐