近期会整理一些多模态理解/多模态cot/rl的相关论文,只总结核心点,挖一些还没做到的关键点

核心创新点

  • 引入结构化思维链 (Structured Chain-of-Thought, SCoT): 该研究首次将结构化思维链引入 Med-VQA 领域,并提出了 Med-SCoT 模型 。通过将推理过程明确分解为四个临床上有意义的阶段,提升了多模态模型的透明度 。

  • 提出多模型协同校正 (CoCo) 标注流水线: 为了克服通用视觉语言模型在医学领域生成推理链时出现的幻觉和逻辑错误,作者设计了一种多模型协同校正的标注策略 。基于此方法,构建了首批三个带有结构化思维链标签的 Med-VQA 数据集(VQA-RAD-SCoT, SLAKE-SCoT, Path-VQA-SCoT) 。

  • 开发全面的推理质量评估框架 SCoTEval: 针对现有指标(如 BLEU、ROUGE)无法有效捕捉医学语义和逻辑一致性的局限,提出了 SCoTEval 。这是一个结合了客观指标和大型语言模型 (LLM) 主观评估的综合框架 。

主要创新点是结构化的cot,符合诊断的流程;两个vlm模型标注,用另一个llm进行纠正和整合,难的例子专家纠错,开源了这个数据;提出了一个基于模型和规则的评判指标


具体做法 (Methodology)

1. Med-SCoT 模型的构建与训练

  • Med-SCoT 基于 LLaVA-Med 模型构建,并采用 LoRA (Low-Rank Adaptation) 技术在提出的 SCoT 数据集上进行参数高效微调 。

  • 模型在训练时利用特殊的结构化标签(如 <SUMMARY>...</SUMMARY>)强制进行分阶段推理,这四个阶段依次为 :

    • 摘要 (Summary):界定核心临床问题并概述诊断或分析计划 。

    • 图像描述 (Caption):识别并描述医学图像中与问题相关的关键放射学特征或感兴趣区域 。

    • 推理 (Reasoning):将临床背景与视觉发现相结合,进行逐步的诊断推理分析 。

    • 结论 (Conclusion):综合上述信息,得出符合逻辑且临床合理的最终答案 。

2. CoCo 数据标注流程

  • 初始化 (Initialization):使用两个不同的视觉语言模型 (VLM) 为医学图像、问题和答案对生成初步的结构化思维链 。

  • 校正 (Correction):引入大型语言模型 (LLM),结合图像的整合文本描述,检查并修正初步 SCoT 中的事实错误、逻辑漏洞或幻觉内容 。

  • 融合 (Fusion):使用 LLM(Deepseek V3) 将上述修正后的不同版本的 SCoT 融合成一个统一的、连贯的最终标注,以减少单一模型的偏差 。

  • 专家验证 (Verification):对于在融合阶段存在语义冲突或逻辑缺陷的疑难样本,交由经验丰富的医学专家进行人工审查和最终确认 。

3. SCoTEval 评估框架的运作机制

  • 该框架从链级别 (Chain-level)阶段级别 (Stage-level) 两个粒度对模型生成的推理链进行评估 。

  • 在客观指标方面,框架计算问题相关性、结构完整性、医学专业知识(医学实体覆盖率)、逻辑一致性(使用 NLI 模型评估阶段间的蕴含关系)以及语义相似度 。

  • 在主观评估方面,框架引入 LLM (如 DeepSeek-V3) 对所有评估维度进行评分(基于 5 分制李克特量表),以弥补客观指标在语义理解上的不足 。

  • 最终得分由客观的指标分数和 LLM 的主观评估分数通过加权融合计算得出(实验中 LLM 权重设置较高),以实现评估的准确性和语义敏感性 。

整体创新比较一般,标注流程和做的事情值得学习,后续会找一些还没做到的点去深挖

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐