更多内容请关注【医学影像 AI by youcans@Xidian 专栏】


0. 论文简介

0.1 基本信息

2025年 Yu Sun 等 在 arxiv 发布数据集 【ReasonMed:ReasonMed:多智能体生成的 370k 大型医疗推理数据集】(ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning)。

本文提出当前规模最大的医疗推理数据集 ReasonMed(含 370k 高质量样本,源自 1.75M 多智能体生成的初始推理路径,经 EMD 流水线筛选优化),并验证融合详细 CoT 推理与简洁摘要的训练策略最优,基于该数据集训练的 ReasonMed-7B/14B 模型在多个医疗 QA 基准任务上表现优异,甚至超越更大参数规模的现有模型,为医疗推理领域提供高质量数据与有效训练方案。

论文下载: nih,tvst
项目地址: github
引用格式: SUN Y, QIAN X Y, XU W W, et al. ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning (EB/OL). (2025-10-09). https://arxiv.org/pdf/2506.09513.

在这里插入图片描述


0.2 论文概览

为解决医疗推理领域数据规模有限、质量不足及推理与摘要策略权衡的问题,研究团队提出ReasonMed—— 当前最大的医疗推理数据集,包含370k 高质量样本(源自 1.75M 初始推理路径);该数据集通过 “生成 - 验证 - 优化” 的多智能体框架构建,结合 Qwen2.5-72B 等 3 个模型生成推理路径,并经 “Easy-Medium-Difficult(EMD)” 流水线筛选优化,ReasonMed-14B 超越 Qwen2.5-14B(+3.8%)并接近 70B 参数模型性能,验证了数据与策略的有效性。

  1. 数据集概述
  • 数据集名称: ReasonMed
  • 规模: 370K 高质量样本,从 1.7M 初始推理路径中提炼
  • 生成方式: 多智能体验证与优化,使用 Error Refiner 修正错误推理步骤
  • 特点: 包含详细的 Chain-of-Thought (CoT) 推理和简洁的答案总结
  1. 数据集生成流程
  • 数据收集: 从 MedQA、MMLU、PubMedQA、MedMCQA 等基准数据集中收集约 195K 问题
  • 多智能体生成: 使用 Qwen-2.5-72B、HuatuoGPT-o1-70B、DeepSeek-R1-Distill-Llama-70B 生成 1.75M 推理路径
  • 质量控制: 通过验证器、质量排名器和错误修正器对推理路径进行多阶段优化,最终生成 370K 高质量样本
  1. 主要贡献
  • 发布最大开源医学推理数据集: 包含 129 万条验证推理路径,优化为 37 万个高质量样本
  • 构建多智能体框架: 设计用于生成、筛选与优化推理路径的多智能体框架 ReasonMed,质量优于 GPT-4o 和 DeepSeek-R1 生成的数据
  • 系统评估显式推理: 在知识密集型医疗问答领域开展首次对照研究,系统评估显式推理的效果
  • 基于推理增强数据微调得到 ReasonMed-7B 模型: 在 sub-10B 模型中达到 SOTA 表现,超越多个更大模型

0.3 摘要

尽管基于推理的大语言模型(LLMs)在数学和编程领域表现出色,但它们在知识密集型医疗问答中的能力仍待深入探索。
为此,我们推出了ReasonMed,这是目前最大的医疗推理数据集,包含37万条高质量示例,这些示例是从由多种LLMs生成的170万条初始推理路径中提炼而来。ReasonMed通过多智能体验证与精炼流程构建,其中我们设计了一个错误修正器,用于识别并纠正由验证器标记的易错步骤,从而提升推理路径的质量。借助ReasonMed,我们系统地研究了训练医疗推理模型的最佳实践,发现将详细的思维链(CoT)推理与简洁的答案摘要相结合,能实现最有效的微调策略。基于此策略,我们训练了ReasonMed-7B模型,该模型为10B以下模型设立了新标杆,较之前最佳模型提升了4.17%,甚至在PubMedQA上超越了LLaMA3.1-70B,领先幅度达4.60%。


1. 引言

近期,以推理为核心的大语言模型(LLMs;DeepSeek-AI,2025;Team,2025)因其在逻辑推理(Liu et al., 2025;Chen et al., 2025)、数学(Ahn et al., 2024)、查询优化(Tan et al., 2025;Huanshuo et al., 2025)及编程(OpenAI et al., 2025)等任务中展现出的卓越能力,受到了广泛关注。

尽管这类模型成效显著,但在医疗领域仍面临独特挑战 —— 医疗领域具有强知识密集属性,需要海量、高质量且经过精准筛选的数据支撑。现有医疗推理数据集(如 medical-o1-reasoning-SFT 和 Medical-R1-Distill-Data(Chen et al., 2024))不仅规模有限,且通常源自单一 “教师模型”,导致知识覆盖范围较窄。此外,以往研究尚未系统分析 “资源密集型多步推理”(Wei et al., 2023)与 “更简洁的摘要式策略” 之间的权衡关系:在医疗问答系统中,显性推理所需的额外计算成本,是否能抵消其相对高效摘要策略的优势,这一问题至今仍未明确。

为应对上述挑战,本文提出医疗推理数据集 ReasonMed—— 该数据集包含 37 万个经过严格验证的样本,规模较现有研究(Chen et al., 2024)提升了一个数量级。ReasonMed 的样本源自多个先进大语言模型,能够捕捉多样化的医疗知识,兼具深度与广度。每一条样本均同时提供详细的多步思维链(CoT)推理过程与简洁的答案摘要,为分析医疗领域的有效推理策略提供了基础。

数据集规模对提升模型性能至关重要。为此,本文采用基于多智能体系统(MAS)的大规模高质量数据生成范式:首先从 MedQA(Jin et al., 2020)、MMLU(Hendrycks et al., 2021)、PubMedQA(Jin et al., 2019)和 MedMCQA(Pal et al., 2022)四大基准中收集约 19.5 万个问题(排除测试集);随后,在多智能体系统中集成三个性能强劲的大语言模型 —— 两个通用模型(Qwen2.5-72B(Team, 2024)、DeepSeek-R1-Distill-Llama-70B(DeepSeek-AI, 2025))与一个医疗专用模型(HuatuoGPT-o1-70B(Chen et al., 2024));通过调整智能体的采样超参数(如温度、top-p),最终生成约 175 万条多样化的多步推理路径。这种 “规模 + 方法严谨性” 的结合,确保了数据质量的提升,进而助力模型在临床问答任务中表现更优。
除数据规模外,训练效果还高度依赖数据质量。已有研究(Muennighoff et al., 2025)表明,即便是 1000 个经过精心筛选的样本,也能让模型取得优异性能。为保证医疗问答的准确性,本文设计了严格的质量控制流水线,从 “答案正确性、逻辑连贯性、医疗事实性” 三个维度验证每条推理链。根据验证通过率,问题被划分为三个等级:简单题(正确路径数≥5)、中等题(正确路径数 2~4)、难题(正确路径数 < 2)。对于简单题,保留经质量排序器(Quality Ranker)筛选出的排名前两位的推理路径;对于中等题(易存在细微错误),由错误优化器(Error Refiner)参考验证器日志、借助 GPT-4o-mini 对路径进行修正与扩充;对于难题,则采用 GPT-o1,通过结构化多步流程直接生成有效推理。经过这一多阶段优化,最终得到包含 37 万个高质量医疗推理样本的数据集。

在筛选高质量推理数据的同时,本文还探究了不同训练策略对模型性能的影响:具体对比了传统思维链(CoT)、摘要式响应、“思维链 - 摘要” 混合三种微调方法,并借助 lm_eval 框架(Gao et al., 2024),确定了提升医疗大语言模型处理复杂问题能力的最优策略。结果显示,混合策略的准确率最高,而仅基于摘要的响应虽计算成本更低,但性能仍具竞争力 —— 这一发现为根据应用需求选择合适策略提供了依据。

为确保模型性能不局限于 “大语言模型自评估”(LLM-as-a-Judge)的范畴,本文还邀请执业医师对 100 个随机抽取的样本进行初步审核。医师评估结果与自动评分高度一致,同时也指出了模型的具体优势(如 87% 的样本具备结构化推理能力、82% 的样本能系统排除干扰项)与待改进方向(如 68% 的样本缺乏足够外部引用、35% 的样本临床细节不足)。此外,本文还验证了模型的良好扩展性:基于 ReasonMed 微调的 140 亿参数模型,在 9 个医疗基准任务上不仅超越了性能强劲的 140 亿 / 320 亿参数基准模型,还逼近了 700 亿参数模型的性能。本文已公开完整的训练与推理细节,并通过温度敏感性分析发现,模型在温度为 0.5~0.7 时准确率达到峰值。

本文的核心贡献可概括为四点:

  • 发布当前最大的开源医疗推理数据集,包含 129 万条验证推理路径,经针对性优化后提炼出 37 万个高质量样本;
  • 设计用于生成、筛选与优化推理路径的多智能体框架,通过 GPT-4o 对 1000 条和 3000 条随机样本的评估证实,ReasonMed 的质量优于 GPT-4o 与 DeepSeek-R1 生成的数据;
  • 在知识密集型医疗问答领域开展首次对照研究 —— 基于同一数据源,分离 “多步推理” 与 “密集知识注入” 的作用,系统评估二者对准确率与效率的影响;
  • 基于推理增强数据微调得到 ReasonMed-7B 模型,在 PubMedQA 任务上准确率达 82.0%,超越 LLaMA3.1-70B(+4.6%);将模型规模扩展至 140 亿参数后,ReasonMed-14B 超越 Qwen2.5-14B(+3.8%)、性能优于 Qwen2.5-32B,并逼近 LLaMA3.1-70B,验证了模型的稳定扩展潜力。

2. 相关工作

2.1 基于多智能体的数据筛选

多智能体框架已被证明在跨领域数据集生成与优化中具备有效性和鲁棒性。这类系统会为智能体分配特定角色,使其以团队协作的方式开展工作(Hong et al., 2023; Li et al., 2025b; Gu et al., 2025a; Qi et al., 2024)。例如,DialogueAgents(Li et al., 2025a)通过脚本编写者、信息整合者和评论者生成多样化、高质量的对话数据;AgentCoder(Huang et al., 2024)则借助程序员、测试设计者和执行者,通过智能体驱动的反馈迭代优化代码数据集。类似地,BOLT(Pang et al., 2025)将多智能体框架与大语言模型结合,生成长链推理数据,凸显了其在结构化、推理密集型任务中的效用。
与现有研究不同,本文提出的框架聚焦于医疗推理数据集,结合领域专用与通用语言模型,生成、验证并优化适用于医疗问答任务的推理路径。


2.2 医疗推理数据集与模型

近期研究表明,思维链(CoT)提示在医疗问答任务中具有有效性(Wei et al., 2022; Liévin et al., 2023)。已有研究提出自适应推理模型(如医疗语言智能体)以应对复杂临床任务(Dutta & Hsiao, 2024);多智能体框架则通过协调专用医疗推理智能体,进一步提升了模型的可靠性与可解释性(Zuo et al., 2025)。HuatuoGPT(Chen et al., 2024)是大模型融合丰富医疗知识与多步推理的典型案例。与此同时,Lingshu 模型构建了统一的多模态基础模型,可协同处理文本与图像类临床问题,在多模态问答及相关基准任务中表现优异(Xu et al., 2025)。尽管 Lingshu 模型侧重统一建模与评估,本文工作则聚焦于通过严格验证与分阶段优化,构建适用于医疗问答的高质量思维链数据集。
现有数据集普遍缺乏针对医疗推理的系统性验证与结构化优化,本文通过多阶段流水线对推理路径进行评估、验证与优化,填补了这一空白,最终生成的数据集在真实性与适用性上均有显著提升。


2.3 基于大语言模型的评估(LLM-as-a-Judge)

大语言模型正越来越多地被用作评估器(即 “LLM-as-a-Judge”),在跨领域评估中展现出可扩展性与一致性(Gu et al., 2025b; Zeng et al., 2024)。在医疗问答领域,这类评估器提升了评估的可靠性与准确性(Krolik et al., 2024; Zhao et al., 2024)。通过迭代审查推理步骤,大语言模型评估器能引导模型生成逻辑连贯的正确答案(Qin et al., 2024)。例如,QuRating(Tang et al., 2024)等框架就凸显了其在系统性筛选高质量训练数据中的作用。

与现有研究不同,本文方法不仅评估大语言模型生成的思维链推理的正确性,还验证其事实真实性,同时明确识别错误以支持针对性优化。此外,本文还引入了基于评分的评估器,可量化优化后推理路径的改进程度,并衡量数据集的整体质量。


3. 多智能体推理流程

3.1 问题收集与整理

为构建覆盖多场景的医疗推理数据集,本文从 4 个权威医疗问答基准中筛选问题,且严格排除各基准的测试集以避免数据泄露,最终形成包含194,925 个问题的基础问题库。具体来源与数量分布如下:

MedQA(Jin et al., 2020):10,178 个训练问题、1,272 个验证问题;
MedMCQA(Pal et al., 2022):182,822 个训练问题;
PubMedQA(Jin et al., 2019):450 个训练问题、50 个验证问题;
MMLU(Hendrycks et al., 2021)医疗相关子领域:涵盖解剖学(Anatomy)、临床知识(Clinical Knowledge)等 6 个方向,共 122 个开发 / 验证问题(如解剖学 5 个开发问题、14 个验证问题)。

所有问题均为选择题(含题干、选项及正确答案),且经过人工核验,确保题干表述准确、选项无歧义,符合医疗场景的专业性要求。

表1. ReasonMed问题数量构成总结。
在这里插入图片描述


3.2 多智能体系统用于复杂CoT生成

我们采用一个多智能体框架——包括Qwen2.5-72B、HuatuoGPT-o1-70B和DeepSeek-R1-Distill Llama-70B——来生成175.5万条推理路径。每个模型在不同温度(0.7、0.9和1.0)下产生三条CoT轨迹。然后,我们按照以下步骤组装复杂的CoT:

  1. 重写问题。
  2. 突出关键临床细节和背景信息。
  3. 评估每个答案选项,并讨论支持证据和潜在陷阱。
  4. 系统地排除与临床背景不一致的选择。
  5. 重新评估每个选项,排除不一致之处。
  6. 以最终答案结束,并附上对推理的简洁解释。

如图2所示,我们在医学问答任务中对DeepSeek-R1-Distill-Llama-70B、HuatuoGPT-o1-70B和Qwen2.5-72B进行了成对比较。具体来说,我们比较了每个模型单独正确回答的问题数量。结果表明,不同模型在各种医学知识领域表现出不同的优势。模型之间在知识领域的差异突显了整合多样化模型输出的多智能体系统的必要性。在图2中,我们在医学问答任务中对DeepSeek-R1-Distill-Llama-70B、HuatuoGPT-o1-70B和Qwen2.5-72B进行了成对比较。具体来说,我们比较了每个模型单独正确回答的问题数量。结果表明,不同模型在各种医学知识领域表现出不同的优势。模型之间在知识领域的差异突显了整合多样化模型输出的多智能体系统的必要性。
为获取多样化、

在这里插入图片描述
图2. DeepSeek-R1-Distill-Llama-70B、HuatuoGPT-o1-70B 和 Qwen2.5-72B之间的知识领域差异。


3.3 组件设计

本节概述了本文开发的组件及其各自的功能。图3中的(2)-(6)可视化了每个组件的结构和工作流程。

在这里插入图片描述
图3. (1) 展示了在不同尺度上应用的SFT示例。 (2) 到 (6) 表示用于构建我们数据集整个流程的组件。


  1. 验证器:
    该组件构建了一个基于Qwen2.5-72B的验证器,用于验证多智能体系统生成的CoT路径的正确性。该模型不仅检查答案是否正确或错误,还评估是否准确识别了关键临床因素,是否分析了所有答案选项,以及医学知识中是否存在事实错误。模型输出一个包含两个键的JSON对象:一个表示裁决结果(正确或错误),另一个提供错误的原因。例如,“CoT分析中关于加压素在糖原分解中的作用存在不准确之处,并且在没有充分考虑其潜在调节作用的情况下错误地排除了催产素。”图4展示了一个柱状图,显示了经过验证器验证后,每个模型和CoT配置在九条生成路径上的正确与错误推理路径的数量。DeepSeek-R1-Distill-Llama-70B实现了最高的整体准确率;Qwen2.5-72B在温度为0.9时保留了最多的正确路径,而其他两个模型的最佳温度为0.7。

在这里插入图片描述
图4. 柱状图展示了在多智能体系统中,每个模型和CoT配置在9条生成路径上的正确和错误计数,总计192,628条。


  1. 回答总结器:
    为了构建类似于o1答案的推理回答,我们使用GPT-4o-mini作为总结助手。该模型为每个复杂的CoT生成一个总结,代表逐步推理过程。该总结作为最终输出呈现给用户,重点关注回答的推理方面。

  2. 质量排名器:
    平衡数据集的大小和质量至关重要。在众多正确的CoT路径中,我们旨在选择两个最优化的路径用于后续训练。基于Qwen2.5-72B的质量排名器在这里发挥了关键作用。该模型读取正确的CoT路径并输出前两名,例如“top2”:[“modelX_COTY”,“modelZ_COTW”],以及排除其他选项的理由。最初,我们考虑使用评分评估器对每个CoT进行评分,但由于可能存在多个CoT具有相同分数的情况,这种方法难以选择最佳路径。因此,我们选择直接通过CoT名称输出两条最佳路径。图5展示了质量排名器在简单流程和中等流程中选择的前两名CoT路径的分布,说明了不同模型和温度设置下的抽样比例。

  3. 错误精炼器:
    该组件处理中等难度的问题。利用质量排名器,它首先选择两条最优化的推理路径(如果只有两条思维链是正确的,则默认选择它们),然后进行二次优化。具体来说,精炼器对标记的步骤进行针对性编辑,同时保留正确的子步骤和结论,从而减少不必要的更改并减轻与原始推理的偏离。其设计还包括在验证阶段存储模型的错误原因,并利用更强的模型来补充和解决这些薄弱点——这种方法有效地纠正了模型容易出错的知识。在此过程中,精炼器优先处理验证器提出的问题(例如,缺失的临床因素、不完整的选项分析或事实错误),并仅修正涉及的段落,随后进行简短的自我一致性检查,以确保最终答案和支持证据保持一致。从经验上看,中等流程的精炼将评分评估器的平均分从7.37提高到8.17(+0.80),验证了错误精炼器的贡献。总体而言,这种局部的、反馈驱动的修正提高了连贯性和事实准确性,而无需全面推翻合理的推理,从而为后续的微调提供了更高质量的监督信号。

  4. 评分评估器:
    该组件利用GPT-4o API对数据集质量进行0到10的评分。我们进行了两项主要实验:第一项比较了同一问题在CoT优化前后的得分,以验证错误精炼器的有效性;第二项通过随机抽样将我们的最终ReasonMed与其他开源医学推理数据集进行比较,以评估我们多智能体方法的有效性。


3.4 ReasonMed构建流程

根据推理路径中检测到的错误数量,创建了三个不同的流程来处理不同难度级别的CoT:

  1. 简单流程(错误数0-4):
    该流程处理错误较少(0-4)的路径,模型较容易正确回答这些问题。在此,我们使用质量排名器对正确路径进行排名,从5-9条正确选项中选择排名前两名的路径。此外,模型还会简要解释为何未选择其他CoT路径。

  2. 中等流程(错误数5-7):
    对于存在中等错误(5-7)的路径,我们假设模型具有部分知识,但可能会遗漏某些细节。因此,我们使用质量排名器选择排名前两名的CoT路径,然后根据验证器提供的问题,利用错误精炼器对这些路径进行优化,专注于纠正这些错误以增强原始正确的推理链。

  3. 困难流程(错误数8-9):
    对于错误较多(8-9)的难题,仅使用GPT-4o模型可能不足以纠正错误。因此,我们使用GPT-o1来优化这些路径。对于完全错误的路径,GPT-o1将从头开始生成高质量的CoT,遵循六步推理过程。

最后,图6展示了不同流程的数量统计,显示了简单、中等和困难流程处理的路径分布。

通过分析验证器验证的正确路径数量,我们可以大致估算每个问题的难度。相应地,我们设计了三个不同的流程来解决不同复杂度的问题,系统地纠正复杂CoT中的错误,并优化原始数据集,以在规模和质量之间达到最佳平衡。

在这里插入图片描述


4. 多尺度监督微调

为了评估明确推理监督对下游医学问答任务的影响,我们提出了一种多尺度微调策略,利用我们高质量数据集的三个变体。
这些变体基于不同的推理粒度,具体如下:

  • CoT:包含六个推理步骤的复杂思维链。
  • Response:由回答总结器从CoT生成的简洁回答。
  • Reason:复杂CoT及其对应的总结回答的组合。

4.1 微调数据构建

利用在第3节中介绍的370K ReasonMed,我们使用回答总结器将每个思维链压缩为简洁的答案解释。对于每个问题q及其对应的多步推理路径Multi−step=[step1,…,step6],我们生成以下实例:

  • CoT 实例:[q;step1,step2,…,step6]→CoT
  • Response 实例:Response Summarizer(CoT)→Response
  • Reason 实例:<think>CoT</think>Response→Reason

CoT、Response和Reason实例旨在封装不同层次的推理和总结,为训练提供不同规模的数据。


4.2 微调与训练

我们使用三种不同的微调方案对开源的Qwen2.5-7B模型进行微调,每个方案对应不同的数据规模。具体来说,我们利用LlamaFactory(Zheng等人,2024)对以下数据集进行3轮监督微调:

  • CoTMed-7B:使用CoT实例进行微调,专注于重现推理过程并生成最终答案。
  • ResponseMed-7B:使用Response实例进行微调,训练模型生成推理路径的简洁总结。
  • ReasonMed-7B:使用Reason实例进行微调,结合详细的推理和总结反馈。

图3(1)展示了SFT过程。为了评估,我们使用lm_eval框架分析这些模型在基准任务上的表现,考察多步推理是否能够增强模型进行医学问答的能力。我们还训练了训练轮数较少的模型,包括仅训练一个轮次的变体,以评估性能差异并研究较少训练步骤的影响。这些实验的结果将在实验部分详细讨论。


4.3 训练细节

我们使用LLaMA-Factory框架在16个H20 GPU集群上对Qwen2.5-7B检查点进行全模型微调。ResponseMed配置大约耗时9小时,而CoTMed和ReasonMed分别大约需要25小时和28小时。


5. 实验

5.1 数据集质量评估

  1. 中等流程有效性验证:
    为评估中等流程(Medium Pipeline)的有效性,我们抽取了 1000 个问题及对应的思维链(CoT,Chain of Thought)样本,并使用评分评估器(Score Evaluator)对应用中等流程(经 GPT-4o-mini 修正)前后的答案质量分别进行评估。对于每个样本项,我们采用相同的评分标准(rubric)和提示词(prompts)进行配对评估,以确保优化前后的评分在完全一致的条件下具有直接可比性。

结果显示,答案质量得到显著提升:优化后的平均评分提高了 0.8 分。这种配对评估设计能够单独衡量错误修正器(Error Refiner)步骤的作用,结果表明,有针对性的编辑在不改变原始问题分布的前提下,提升了答案的连贯性、事实准确性和选项分析质量。具体评分如下:

在这里插入图片描述


  1. 与开源数据集的对比

我们将 ReasonMed 数据集与两个公开的开源医学推理语料库进行对比,这两个语料库分别是 medical-o1-reasoning-SFT 和 Medical-R1-Distill-Data。为保证对比的公平性,我们从这两个对比数据集中各抽取 1000 个样本,并为 ReasonMed 额外补充 3000 个样本以扩展数据集。

结果显示,ReasonMed 的表现优于两个基准数据集。其中,ReasonMed 的 1000 个样本子集平均得分为 8.45,3000 个样本子集平均得分为 8.50。相较于其他两个开源数据集,这两个得分分别实现了 3.9% 和 5.9% 的提升。

在这里插入图片描述


5.2 多粒度监督微调(Multiscale Supervised Fine-Tuning)

本节将全面分析采用本文提出的多粒度监督微调(SFT,Supervised Fine-Tuning)策略,对 Qwen2.5-7B 模型进行微调后得到的实验结果。不同医学问答(QA,Question-Answering)基准数据集的性能对比细节如表 4 所示,涉及 MedQA、MedMCQA、PubMedQA 和 MMLU。实验结果表明,在多个粒度上融入显式推理监督具有显著有效性,具体表现如下:

  1. 不同模型变体的性能对比
    通过微调得到的三个模型变体(CoTMed-7B、ResponseMed-7B、ReasonMed-7B),在各基准数据集上表现出差异化特征:

    • CoTMed-7B:在多数基准数据集上持续优于基准模型,在 MedQA(66.3%)、MedMCQA(64.7%)和 PubMedQA(80.0%)中得分显著更高。这表明,基于复杂推理链进行微调,能大幅提升模型执行医学推理任务的能力。
    • ResponseMed-7B:仅专注于生成简洁摘要,整体表现具有竞争力,在 MedQA 中得分较高(67.5%),但整体准确率(67.0%)略低于 CoTMed-7B(69.1%)。这说明,摘要生成虽能有效捕捉关键信息,但可能遗漏复杂问题所需的精细推理步骤。
    • ReasonMed-7B:结合了详细推理链与简洁摘要,取得了最高的整体准确率(69.6%),尤其在 MedMCQA(65.1%)和 PubMedQA(82.0%)中表现突出。这种混合方法能有效利用两种粒度的优势,在不同问题类型上实现均衡且稳健的性能。
  2. 训练轮次(Epochs)对性能的影响
    为探究训练时长的作用,实验还对比了不同训练轮次下的模型性能:

    • 1 轮训练(One Epoch Training):仅训练 1 轮的模型性能虽有潜力,但弱于训练 3 轮的模型。其中,CoTMed-1 轮的整体准确率为 67.8%,略高于 ReasonMed-7B-1 轮(67.7%),且显著优于 ResponseMed-7B-1 轮(64.8%)。
    • 3 轮训练(Three Epoch Training):训练 3 轮的模型在所有基准数据集上性能均有提升,清晰体现了延长训练的优势 —— 整体准确率从 1 轮的 67.71% 提升至 3 轮的 69.63%。
    • 此外,实验还发现一个关键规律:在训练步骤有限时,CoTMed-7B 性能优于 ReasonMed-7B;但随着训练步骤增加,ReasonMed-7B 最终会以 0.54% 的优势超过 CoTMed-7B。更多的训练可能让模型更有效地学习复杂 CoT 推理与简洁摘要之间的内在关联,从而进一步提升性能。

表4 各模型在MedQA、MedMCQA、PubMedQA和MMLU基准测试中的性能比较,包括总准确率和平均token长度。
其中,CK、C-Bio、C-Med、Med-Gene和P-Med分别表示临床知识、大学生物学、大学医学、医学遗传学和专业医学。我们以两个清晰分隔的区块呈现结果:模型规模<10B和模型规模>10B。

在这里插入图片描述


  1. 平均token长度分析:为了计算这些平均值,每个模型在推理模式下对整个测试集进行了评估,并记录了生成的token的平均数量。CoTMed-7B(≈555个token)和ReasonMed-7B(≈626个token)始终比ResponseMed-7B(≈225个token)产生更长的输出,这表明它们以牺牲简洁性为代价,进行了更复杂的推理过程。与HuatuoGPT-o1-7B(≈446个token)相比,我们的CoTMed和ReasonMed变体展示了更广泛的思维链。值得注意的是,尽管ResponseMed-7B生成的token数量显著较少,但其总体准确率仍超过了HuatuoGPT-o1模型,这突显了数据集规模和质量在塑造模型性能中的决定性作用。

  2. 与其他生物医学大语言模型(如BioMistral-7B、Llama3-OpenBioLLM-8B和HuatuoGPT-o1)相比,我们的ReasonMed-7B在医学问答任务中表现出了卓越的性能,在基准测试中获得了最高的综合指标。它超过了同类规模中最强大的模型4.17%,甚至在多次评估中超过了某些十亿参数系统的性能(见附录)。这些发现强调了数据集质量和规模的关键作用,同时进一步强调了明确的多步推理在推进医学问答中的有效性。此外,随着训练迭代的增加,ReasonMed-7B逐渐内化了复杂推理链与简洁答案表述之间的联系,从而在整体能力上取得了显著的提升。

  3. 扩展到7B以上:为了在实际计算限制下严格评估可扩展性,我们将研究从7B扩展到14B参数骨干,同时保持相同的训练协议。在九个医学基准测试中,包括MedQA、MedMCQA(验证集)、PubMedQA和六个MMLU医学子领域(解剖学、临床知识、大学生物学、大学医学、医学遗传学和专业医学),ReasonMed-14B的总体准确率为72.8%。这一性能比Qwen2.5-14B(69.0%)提高了3.8%,超过了Qwen2.5-32B(72.6%),几乎与LLaMA3.1-70B(72.9%)持平。这些发现强调了我们的以数据为中心的范式在14B规模上提供了持续的扩展改进和卓越的数据效率,显著缩小了与更大模型的差距,同时避免了其高昂的训练成本。

  4. 实现、成本和解码总结(见附录):为了确保可重复性和实际预算,我们在附录中提供了一套完整的实现细节。具体来说,我们报告了:(i)涵盖数据生成、训练和推理的计算概况(C,表5);(ii)完整的训练和默认推理超参数(D,表6);(iii)解码扫描表明,准确率在温度范围[0.5,0.7]内趋于稳定(E,表7);以及(iv)成本分析,比较了直接GPT-o1蒸馏与我们的选择性EMD流程,后者实现了约3.6倍的成本降低(F,表8)。完整的数值结果和操作规格包含在引用的附录部分中。


6. 结论

在本研究中,我们介绍了ReasonMed,这是迄今为止最大的专注于医学推理的开源数据集,旨在提升模型在复杂医学问答任务中的表现。借助多智能体框架,我们系统地生成、验证并优化了129.1万条推理轨迹,并将其精炼为37万条高质量样本。
广泛的实验结果证实,明确的多步推理能够显著提升性能,我们融合了思维链推理与总结的混合范式,实现了最先进的结果。值得注意的是,ReasonMed-7B/14B模型始终超越强大的基线模型,甚至超过了参数规模大得多的同类模型。这些结果突显了推理在医学问答中的关键作用,并为知识密集型领域的未来研究建立了一种可扩展的、以数据为中心的方法论。
除了医学领域,我们的框架还为构建特定领域的推理数据集提供了可转移的蓝图,为跨多学科的广泛应用奠定了基础。

局限性(Limitations)
尽管我们将研究从 7B 模型扩展到 14B 模型骨干网络,并在多个基准测试中报告了可与 14B、32B 甚至 70B 模型竞争的结果,但本研究的分析仍存在以下几方面局限性:

  • 大模型消融实验缺失:在相同的训练方案下,我们尚未对 14B 以上的模型(如 32B、70B)进行完整的消融实验。因此,这种以数据为中心的方法在前沿模型规模(指超大规模模型)下的可扩展性,目前仅得到部分验证。
  • 依赖大语言模型评判器:研究中的部分过滤环节(验证器 Verifier、质量排序器 Quality Ranker)和自动质量评估环节(评分评估器 Score Evaluator),依赖于性能强劲的大语言模型(LLM)评判器,如 Qwen2.5-72B 和 GPT-4o。
  • 潜在的评判偏差与误差:尽管已进行初步的医生审核,但对上述大语言模型评判器的依赖,仍可能导致评判器的偏差和系统性误差被传递到研究结果中。

7. Github 项目使用

项目地址: githubhuggingface

ReasonMed 是一个综合性的多智能体生成数据集,旨在提升医学推理能力。它配备了多种工具和模块,用于在医学领域生成、验证、优化、排名、总结和评估思维链(Chain-of-Thought, CoT)响应。ReasonMed 的目标是帮助研究人员和从业者改进并评估临床决策中的医学推理能力。

文档提供了 ReasonMed 核心功能的概述、安装说明、使用示例以及如何将每个模块集成到您的医学推理工作流程中。


7.1 ReasonMed 快速安装

  1. 克隆仓库
    要开始,请克隆 ReasonMed 仓库:
git clone https://github.com/YuSun-Work/ReasonMed.git 
cd ReasonMed
  1. 依赖项
conda create -n reasonmed python=3.11 -y
conda activate reasonmed
pip install -r requirements.txt

注意:确保您能够访问脚本中提到的模型或端点,以便进行推理。


7.2 ReasonMed 主要模块介绍

  1. 生成思维链(CoT)
    该模块从三种不同的模型中生成多个思维链(CoT)响应,每个模型为给定问题生成三个 CoT。
    命令示例:
python generate_9cot.py --data_path /path/to/question.json --model_path1 /path/to/model1 --model_path2 /path/to/model2 --model_path3 /path/to/model3 --json_path /path/to/save_cot.json

输入示例(question.json)如下:

[
    {
        "question": "Chronic urethral obstruction due to benign prostatic hyperplasia can lead to the following change in kidney parenchyma",
        "options": [
            "Hyperplasia",
            "Hypertrophy",
            "Atrophy",
            "Dysplasia"
        ]
    }
]

其中:

  • data_path:包含临床问题和多项选择选项的 JSON 文件路径。
  • model_path1, model_path2, model_path3:用于生成 CoT 的三个模型路径。
  • json_path:保存生成的 CoT 的路径。

输出:
生成的 CoT 将保存在指定的 JSON 文件中。

中间文件:
intermediate.json 可用于在每个阶段后存储结果,便于调试或故障排除。

  1. 验证思维链
    该脚本通过验证其与临床推理的一致性来验证生成的 CoT。
    命令示例:
python quality_ranker.py --input_json /path/to/save_cot.json --model_path /path/to/eval_model --intermediate_file /path/to/intermediate.json --final_output /path/to/final_results.json

其中:

  • input_json:包含生成的 CoT 的 JSON 文件路径。
  • model_path:用于评估 CoT 的模型路径。

输出:
验证 CoT 并输出结果(例如,正确、错误)。

  1. 质量排名器
    质量排名器对每个临床问题生成的 CoT 进行排名,保留最有效的前两个 CoT。
    命令示例:
python quality_ranker.py --input_json /path/to/save_cot.json --model_path /path/to/eval_model --intermediate_file /path/to/intermediate.json --final_output /path/to/final_results.json

其中:

  • input_json:要评估和排名的 CoT 的 JSON 文件。
  • model_path:用于排名的模型路径。
  • intermediate_file:保存中间排名结果的路径。
  • final_output:保存最终排名的 CoT 的路径。
    输出:
    对 CoT 进行排名,并保存每个临床问题的最佳两个 CoT。
  1. 错误优化器
    该模块通过利用错误反馈来改进推理过程,优化存在错误或推理不完整的 CoT。
    命令示例如下:
python error_refiner_openai.py --input_json /path/to/save_cot.json --api_key /path/to/api_key --azure_endpoint /path/to/azure_endpoint --model /path/to/refine_model --output_json /path/to/refined_output.json

其中:

  • input_json:包含要优化的生成 CoT 的 JSON 文件路径。
  • api_key:您的 Azure OpenAI API 密钥。
  • azure_endpoint:Azure OpenAI API 的端点。
  • model:优化模型的路径。
  • output_json:保存优化后的 CoT 的路径。
    输出:
    优化后的 CoT,结合了前一次迭代中的错误修正。
  1. 差异优化器
    该模块使用 Azure OpenAI API 对 CoT 进行高级优化。它专注于基于详细反馈的深度推理改进。
    命令示例:
python diff_opti.py --input_json /path/to/save_cot.json --output_json /path/to/optimized_cot.json --api_key /path/to/api_key --azure_endpoint /path/to/azure_endpoint --model /path/to/optimize_model

其中:

  • input_json:包含要优化的 CoT 的 JSON 文件路径。
  • output_json:保存优化后的 CoT 的路径。
  • api_key:您的 Azure OpenAI API 密钥。
  • azure_endpoint:Azure OpenAI 端点。
  • model:用于深度优化的模型。
    输出:
    经过深度分析和改进的优化后的 CoT。
  1. 响应总结器
    该模块为每个 CoT 生成简洁的总结,将冗长的推理转化为一句话的解释。
    命令示例:
python response_summarizer.py --input_json /path/to/save_cot.json --model /path/to/summary_model --azure_endpoint /path/to/azure_endpoint --api_key /path/to/api_key --results_file /path/to/summaries.json

其中:

  • input_json:包含要总结的 CoT 的 JSON 文件路径。
  • model:用于总结的模型。
  • azure_endpoint:Azure OpenAI API 的端点。
  • api_key:您的 Azure OpenAI API 密钥。
  • results_file:保存总结后的 CoT 的路径。
    输出:
    每个 CoT 的简洁总结的 JSON 文件。
  1. 评分评估器
    该模块基于多个标准评估 CoT 的临床准确性,并为每个 CoT 生成评分。
    命令示例:
python score_evaluator.py --input_jsons /path/to/save_cot.json --model /path/to/score_model --azure_endpoint /path/to/azure_endpoint --api_key /path/to/api_key --final_output /path/to/scores.json

其中:

  • input_jsons:包含要评估的 CoT 的输入 JSON 文件。
  • model:用于评分的模型路径。
  • azure_endpoint:Azure OpenAI API 的端点。
  • api_key:您的 Azure OpenAI API 密钥。
  • final_output:保存最终评估分数的路径。
    输出:
    基于临床准确性、推理和完整性的每个 CoT 的评分。

7.3 ReasonMed 示例流程

  1. 简单流程:生成并评估 CoT
python generate_9cot.py --data_path /path/to/question.json --model_path1 /path/to/model1 --model_path2 /path/to/model2 --model_path3 /path/to/model3 --json_path /path/to/save_cot.json
python verifier.py --input_json /path/to/save_cot.json --model_path /path/to/eval_model
python quality_ranker.py --input_json /path/to/save_cot.json --model_path /path/to/eval_model --intermediate_file /path/to/intermediate.json --final_output /path/to/final_results.json
  1. 中等流程:生成、评估、排名和优化 CoT
python generate_9cot.py --data_path /path/to/question.json --model_path1 /path/to/model1 --model_path2 /path/to/model2 --model_path3 /path/to/model3 --json_path /path/to/save_cot.json
python verifier.py --input_json /path/to/save_cot.json --model_path /path/to/eval_model
python quality_ranker.py --input_json /path/to/save_cot.json --model_path /path/to/eval_model --intermediate_file /path/to/intermediate.json --final_output /path/to/final_results.json
python error_refiner_openai.py --input_json /path/to/save_cot.json --api_key /path/to/api_key --azure_endpoint /path/to/azure_endpoint --model /path/to/refine_model --output_json /path/to/refined_output.json
  1. 复杂流程:进行高级优化
python generate_9cot.py --data_path /path/to/question.json --model_path1 /path/to/model1 --model_path2 /path/to/model2 --model_path3 /path/to/model3 --json_path /path/to/save_cot.json
python verifier.py --input_json /path/to/save_cot.json --model_path /path/to/eval_model
python error_refiner_openai.py --input_json /path/to/save_cot.json --api_key /path/to/api_key --azure_endpoint /path/to/azure_endpoint --model /path/to/refine_model --output_json /path/to/refined_output.json
python diff_opti.py --input_json /path/to/save_cot.json --output_json /path/to/optimized_cot.json --api_key /path/to/api_key --azure_endpoint /path/to/azure_endpoint --model /path/to/optimize_model

ReasonMed 提供了一个用于生成、优化、验证和评估医学思维链响应的集成框架。这一全面的流程对于推进人工智能驱动的临床推理和决策模型至关重要。


在这里插入图片描述


8. 参考文献

Tom 

引用格式: SUN Y, QIAN X Y, XU W W, et al. ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning (EB/OL). (2025-10-09). https://arxiv.org/pdf/2506.09513.

版权说明:
youcans@xidian 作品,转载必须标注原文链接:
【医疗推理数据集】ReasonMed:多智能体生成的 370k 大型医疗推理数据集
(https://youcans.blog.csdn.net/article/details/153975644)
Crated:2025-11

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐