Qwen2.5-vl 技术报告阅读笔记
·
模型结构

- 文本模态采用Qwen2.5 LLM,同时为了多模态的对齐理解,修改了1D RoPE为Multimodal RoPE,对齐绝对时间
- 视觉模态采用ViT结构,结合2D RoPE和Window attention使其支持原生分辨率输入并且加速视觉编码器的计算
- 多模态对齐:基于MLP的视觉-语言合并。

预训练方案

训练分为三个阶段:仅训练视觉、多模态数据训练、长序列训练
- Visual Pre-Training:仅训练ViT,数据来源为图片描述、视觉知识和OCR数据
- Multimodal Pre-Training:解冻所有的参数层,在多模态图片数据上训练,数据引入了如交错数据、多任务学习数据集、视觉问答、多模态数学、agent-base、视频理解和纯文本数据
- Long-Context Pre-Training:在第三阶段,主要是为了提高对长序列数据的推理能力,引入更多的视频和agent-base数据,同时加长序列长度。
文章中提到:视觉编码器的参数量是少于文本模态的参数量的。之所以采用不同的序列长度进行训练,是为了平衡计算负载。
在前两个阶段,数据统一为8192的序列长度,但是在最后一个阶段,将序列长度增加到32768.
微调方案
- 纯文本数据(50%)
- 多模态数据(50%)
- 虽然多模态数据和纯文本数据构成的比例一致,但由于多模态数据引入计算量显著增加。文本数据主要是中英文;
- 涵盖通用视觉问答(VQA)、图像描述、数学问题解决、编码任务和安全相关查询
- 针对文档和光学字符识别(Doc和OCR)、视觉定位、视频分析和代理交互构建了专用数据集
数据清洗
双阶段数据清洗流程
- 领域特定分类:利用Qwen2-VL-Instag(专用分类模型,from Qwen2-VL-72B),对问答对分类为八个主要领域,并进一步细化为30个细粒度子类别;
- 领域定制清晰清洗:结合规则和模型
- 基于规则:预定义的启发式方法剔除低质量或有问题的条目。如文档处理、OCR和Visual Grounding,识别并删除重复模式,防止模型训练失真。排除包含不完整、截断或格式不当的响应条目,用于合成数据集和多模态场景;有害信息丢弃
- 基于模型:训练基于Qwen2.5VL的奖励模型,优化数据集。在Visual Grounding中,需要注意验证视觉信息的准确表达和利用
采用Rejection Sampling:提高VLM的推理能力(需要多步推理的任务如数学、代码生成或专业领域QA)
- 问题:原始数据质量参差不齐,错误的样本或不清晰的推理步骤会误导模型
- 一种数据过滤的手段
- 步骤:
- 先准备带有“正确答案”的数据集(ground truth annotations)。
- 这些任务都是需要多步推理的,比如解题步骤、代码生成、视觉问答。
- 用一个中间版本的 Qwen2.5-VL 模型来尝试解这些任务。
- 如果模型的输出结果与标准答案一致,就保留该样本。
- 如果结果不对,就丢弃。
效果:数据集中只留下高质量的、模型能正确完成的例子。
- 进一步的过滤条件:
- 去掉代码切换(code-switching,指在同一句里混合多种语言的现象,比如英文里突然夹杂中文)
- 去掉过长的回答
- 去掉重复的模式
- 先准备带有“正确答案”的数据集(ground truth annotations)。
- 难点:在CoT里,模型可能只关注文本模态,并没有利用视觉模态
- 利用规则和模型驱动的方式检测推理过程中的每一步,确保其正确的结合了文本和视觉模态信息
- 目的:保证推理链条(CoT reasoning)既有语言逻辑也利用到了视觉语义
训练方案
包括两个阶段,监督微调和直接偏好优化(DPO),同时在此期间VisualTransformer(ViT)冻结参数。
- SFT:在大规模、多样化的监督数据上微调
- 数据:包括图文对、视频和纯文本,数据来源为通用VQA、rejection sampling、文档和OCR、Visual Grounding、agent等;
- 目的:让模型掌握多模态任务的基本能力,覆盖面广,尤其是需要跨模态推理的任务
- DPO:基于人类偏好数据做对齐训练
- 数据:仅利用图文对以及纯文本数据
- 方法:每个样本仅处理一次;用Direct Preference Optimization,直接优化偏好对
- 目的:让模型输出更符合人类偏好,改善对齐效果(alignment with user intent)
关键:视觉部分在预训练时已训练好,因此不需要更新权重,后训练主要是调整的推理和偏好对齐
先用监督微调(SFT)让模型在多模态任务上学会更强的推理和任务能力,再用偏好优化(DPO)让它的回答更符合人类期望
知识补充(Window attention)
self-attention:![![[Pasted image 20250728112534.png]]](https://i-blog.csdnimg.cn/direct/47d8640fd10f4e87aa998769acacf3f7.png)
window attention作为一种稀疏注意力机制,具体细节。
更多推荐



所有评论(0)