模型结构

请添加图片描述

  • 文本模态采用Qwen2.5 LLM,同时为了多模态的对齐理解,修改了1D RoPE为Multimodal RoPE,对齐绝对时间
  • 视觉模态采用ViT结构,结合2D RoPE和Window attention使其支持原生分辨率输入并且加速视觉编码器的计算
  • 多模态对齐:基于MLP的视觉-语言合并。
    请添加图片描述

预训练方案

请添加图片描述

训练分为三个阶段:仅训练视觉、多模态数据训练、长序列训练

  • Visual Pre-Training:仅训练ViT,数据来源为图片描述、视觉知识和OCR数据
  • Multimodal Pre-Training:解冻所有的参数层,在多模态图片数据上训练,数据引入了如交错数据、多任务学习数据集、视觉问答、多模态数学、agent-base、视频理解和纯文本数据
  • Long-Context Pre-Training:在第三阶段,主要是为了提高对长序列数据的推理能力,引入更多的视频和agent-base数据,同时加长序列长度。

文章中提到:视觉编码器的参数量是少于文本模态的参数量的。之所以采用不同的序列长度进行训练,是为了平衡计算负载。

在前两个阶段,数据统一为8192的序列长度,但是在最后一个阶段,将序列长度增加到32768.


微调方案

  • 纯文本数据(50%)
  • 多模态数据(50%)
  • 虽然多模态数据和纯文本数据构成的比例一致,但由于多模态数据引入计算量显著增加。文本数据主要是中英文;
  • 涵盖通用视觉问答(VQA)、图像描述、数学问题解决、编码任务和安全相关查询
  • 针对文档和光学字符识别(Doc和OCR)、视觉定位、视频分析和代理交互构建了专用数据集

数据清洗

双阶段数据清洗流程

  • 领域特定分类:利用Qwen2-VL-Instag(专用分类模型,from Qwen2-VL-72B),对问答对分类为八个主要领域,并进一步细化为30个细粒度子类别;
  • 领域定制清晰清洗:结合规则和模型
    • 基于规则:预定义的启发式方法剔除低质量或有问题的条目。如文档处理、OCR和Visual Grounding,识别并删除重复模式,防止模型训练失真。排除包含不完整、截断或格式不当的响应条目,用于合成数据集和多模态场景;有害信息丢弃
    • 基于模型:训练基于Qwen2.5VL的奖励模型,优化数据集。在Visual Grounding中,需要注意验证视觉信息的准确表达和利用

采用Rejection Sampling:提高VLM的推理能力(需要多步推理的任务如数学、代码生成或专业领域QA)

  • 问题:原始数据质量参差不齐,错误的样本或不清晰的推理步骤会误导模型
  • 一种数据过滤的手段
  • 步骤:
    1. 先准备带有“正确答案”的数据集(ground truth annotations)。
      • 这些任务都是需要多步推理的,比如解题步骤、代码生成、视觉问答。
    2. 用一个中间版本的 Qwen2.5-VL 模型来尝试解这些任务。
      • 如果模型的输出结果与标准答案一致,就保留该样本。
      • 如果结果不对,就丢弃
        效果:数据集中只留下高质量的、模型能正确完成的例子
    3. 进一步的过滤条件
      • 去掉代码切换(code-switching,指在同一句里混合多种语言的现象,比如英文里突然夹杂中文)
      • 去掉过长的回答
      • 去掉重复的模式
  • 难点:在CoT里,模型可能只关注文本模态,并没有利用视觉模态
    • 利用规则和模型驱动的方式检测推理过程中的每一步,确保其正确的结合了文本和视觉模态信息
    • 目的:保证推理链条(CoT reasoning)既有语言逻辑也利用到了视觉语义
不满足
满足
不通过
通过
原始多模态数据集
(含Ground Truth标注)
中间版本Qwen2.5-VL
生成推理结果
结果是否匹配
Ground Truth?
丢弃样本
额外过滤条件
(code-switching, 冗长, 重复)
模态对齐检查
(视觉+文本验证)
高质量推理数据集
用于模型再训练
增强Reasoning能力

训练方案

包括两个阶段,监督微调和直接偏好优化(DPO),同时在此期间VisualTransformer(ViT)冻结参数

  • SFT:在大规模、多样化的监督数据上微调
    • 数据:包括图文对、视频和纯文本,数据来源为通用VQA、rejection sampling、文档和OCR、Visual Grounding、agent等;
    • 目的:让模型掌握多模态任务的基本能力,覆盖面广,尤其是需要跨模态推理的任务
  • DPO:基于人类偏好数据做对齐训练
    • 数据:仅利用图文对以及纯文本数据
    • 方法:每个样本仅处理一次;用Direct Preference Optimization,直接优化偏好对
    • 目的:让模型输出更符合人类偏好,改善对齐效果(alignment with user intent)

关键:视觉部分在预训练时已训练好,因此不需要更新权重,后训练主要是调整的推理和偏好对齐

先用监督微调(SFT)让模型在多模态任务上学会更强的推理和任务能力,再用偏好优化(DPO)让它的回答更符合人类期望


知识补充(Window attention)

self-attention:![[Pasted image 20250728112534.png]]

window attention作为一种稀疏注意力机制,具体细节。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐