Chemical knowledge-informed framework for privacy-aware retrosynthesis learning融入化学知识的隐私保护型逆合成学习框架
0.基本信息
Chemical knowledge-informed framework for privacy-aware retrosynthesis learning
作者团队来自浙江大学和中国人民大学
2025.9.25发表于Nature Communications

1.1背景介绍
首先,逆合成(Retrosynthesis)是从目标分子出发,反向推导出可能的合成前体和步骤。传统方法主要依赖化学专家经验和规则模板,虽然精确但缺乏泛化能力,难以发现新的反应路线。随着 AI 的发展,尤其是深度学习模型(如 Transformer、Seq2Seq),可以从大量反应数据中学习复杂的化学规律,并在公开数据集(如 USPTO)上超过人类化学家的预测准确率。但这些化学反应数据是各大药企和实验室的绝对商业机密(敏感性),他们绝不可能将原始数据上传到中心服务器。这就导致了严重的“数据孤岛”问题,限制了 AI 模型的潜力。因此,产生了“数据隐私与模型性能的矛盾”,这篇论文就是为了解决这个问题。

1.2研究动机
虽然联邦学习(Federated Learning)能解决隐私问题,但化学数据间的差异是极端异构的(Non-IID),这里的异构就是指不同客户端的数据分布差异巨大。正如我们后面实验会看到的,简单的FedAvg平均会导致模型性能崩溃。
针对这个问题,本文提出了一个新的框架——CKIF(Chemical Knowledge-Informed Framework)。它的核心思想是:利用化学知识(如分子指纹、反应特征)来引导模型聚合的加权过程,使得每个客户端的模型融合更加智能化和个性化。在这种机制下,各机构的数据不离开本地,只上传模型参数;服务器汇总后更新全局模型。这样既能协同训练,又能保护隐私。

2.1方法——CKIF框架
下面主要介绍论文提出的核心框架——CKIF(Chemical Knowledge-Informed Framework)
图中黑色框部分展示了两种传统模式:a图是 Local Learning(本地学习),每个机构在自己的数据上独立训练模型,虽然保护隐私,但缺点是模型之间无法共享知识。b图是 Central Learning(集中学习),所有机构把数据上传到服务器统一训练,模型效果很好,但隐私泄露风险极高,特别是制药、化工企业的数据往往属于商业机密。
蓝色框部分就是本文提出的 CKIF 框架。它结合了联邦学习(Federated Learning)的思路,让各客户端在本地训练模型,然后将模型参数上传到服务器。服务器不会看到任何原始数据,而是根据各客户端模型的表现进行聚合更新。不同的是,这里引入了d图中展示的化学知识引导机制CKIW(chemical knowledge-informed weighting):每个客户端训练完后,会预测一组反应物(predicted reactants);系统将预测结果与真实反应物(ground-truth)进行比对,通过分子指纹(fingerprint)相似度来判断模型质量;相似度高的模型权重更大,相似度低的权重更小。这样模型融合就不仅仅是“数学平均”,而是“化学上更合理”的聚合过程。

下面重点介绍 CKIF 的运行流程,分为 输入(Input)—过程(Process)—输出(Output) 三个阶段。
首先是输入阶段(Input):如果是第一轮训练,模型参数是随机初始化的;【 什么是“随机初始化” Random Initialization?就是给模型参数随机地赋予一些很小的数值(比如在-0.1到0.1之间随机选一个数)。为什么是随机的? 如果所有参数都从同一个值(比如都从 0)开始,那么在训练过程中,所有参数的更新都会一模一样,模型就没法学到复杂、有用的特征。随机地给它们不同的起点,它们就能独立地学习不同的知识。“for the 1st round” 是什么意思?CKIF(联邦学习)是一个迭代的过程,它会重复很多轮(Round 1, Round 2, Round 3...)。没有上一轮的“聚合模型”可以用。所以,所有客户端只能从“随机初始化”开始。】如果是后续轮次,则继承上一轮聚合后的个性化模型。
中间过程(Process):各客户端(比如不同实验室或药企)在自己掌握的私有数据上独立训练n个 Epoch;优化目标是最小化逆合成任务的交叉熵损失;在本地训练完成后,模型参数被发送到服务器进行聚合。
最后是输出阶段(Output):每个客户端都会接收到更新后的个性化模型;整个过程中,原始反应数据始终保留在本地,从而保证隐私安全。
服务器端的关键创新是 CKIW(Chemical Knowledge-Informed Weighting)策略。服务器为每个客户端定制一套加权方式;通过比较各模型预测产物与真实产物的分子指纹相似度,来评估模型表现;然后根据这些相似度分配权重,更新全局模型。

2.2方法——CKIF算法流程图
这页展示了框架对应的算法细节,也就是伪代码部分。可以分为两个模块:
Box 1:Overall Framework(总体框架)
每个客户端在本地数据上独立训练模型,并上传参数到服务器;
服务器端聚合时,不使用简单平均,而是结合化学知识进行加权;
通过多轮通信迭代(Round 1 → Round T),实现逐步优化。
Box 2:Weighting Strategy(加权策略)
每个客户端在不共享数据的前提下,评估其他客户端模型的预测效果;
具体做法是计算模型预测结果和真实反应产物之间的分子指纹相似度(Fingerprint Similarity);
模型预测得越“像化学家会预测的”,它的权重越大。
最终的聚合过程可以理解为:FedAvg 是“数学平均”,而 CKIF 是“化学平均”——它让聚合模型更符合反应机理,也更有解释性。

3.1实验结果——CKIF模型效果评估
这张图展示了不同模型在 10 类化学反应类型 上的预测准确率比较。横轴是反应类型,比如杂原子烷基化、酰化反应、C–C键形成、氧化、还原等;纵轴是 Top-10 准确率,也就是正确答案出现在前十个预测中的比例。从图中我们可以看到三个模型的对比:浅黄色是 Locally Trained,每个客户端自己训练,信息不共享,效果最差;灰色是 FedAvg,标准联邦学习,性能一般;深蓝色是 CKIF,本文提出的模型,在所有反应类型上都明显更高。说明加入化学知识引导确实能提升模型的化学理解能力;即便在隐私受限的条件下,模型性能依旧能超过集中式学习的传统方法。
总结:CKIF 实现了隐私保护与模型性能的双赢。
3.2实验结果——逆合成预测结果的“定性比较”
这页展示的是模型预测结果的可视化对比。
每一列代表一个客户端:
(a) 是来自 USPTO-50K 数据集的酰化反应;
(b) 是来自 MIT 数据集的环化反应;
(c) 是来自混合数据集的复杂反应。
从上到下分别是:输入产物(Input Product)、真实反应物(Ground Truth)、以及三种方法的预测结果(Local、Central、FedAvg、CKIF)。
我们可以看到:本地模型经常预测不全或完全错误;FedAvg 尽管融合了多源信息,但预测分子结构仍有明显偏差;而 CKIF 的预测结果与真实反应物一致,说明它的化学知识理解更精准。

3.3实验结果——消融实验(USPTO-50K数据集)
这一页是消融实验,用来验证 CKIF 各个模块的作用
图 a 比较是否加入化学知识加权模块(w/ vs. w/o CKIW):可以看到加入化学知识后,准确率从 47.9% 提升到了 48.8%,说明化学指导确实有效。
图 b 分析通信轮次(communication rounds)对性能的影响:横轴是通信轮次,从 30 到 50;轮次越多,模型间的协作越充分,准确率逐渐上升。
图 c 研究参与客户端数量对模型性能的影响:客户端从 2 个增加到 4 个后,准确率提升显著,表明数据来源越丰富,模型泛化性越强。
三个子实验的结论是一致的:化学知识引导能提高模型的可解释性;多轮通信和多客户端能提高模型的稳定性与泛化能力。

3.4实验结果——CKIF模型的鲁棒性表现
这张图考察的是 CKIF 模型的鲁棒性,也就是它对“脏数据”的耐受能力。
图中 (a)–(d) 分别对应四个客户端(C₁–C₄),横轴是污染数据比例(0%、5%、10%、15%、20%),纵轴是平均准确率。
从结果可以看到:随着污染比例增加,所有模型性能都会下降;但 CKIF(深蓝色)始终明显高于本地模型(灰色)。说明 CKIF 在数据存在错误或偏分布的情况下,依旧能保持较高性能。
其原因在于:联邦聚合使得模型能从多个数据源中学习到“纠错信息”;化学知识加权机制能削弱被污染数据的影响,让模型更稳健。
最终证明:CKIF 不仅精准,而且抗噪、可靠。

4.总结启发
总结:论文证明隐私与性能不是对立的,只要在聚合中引入化学知识,联邦框架也能接近甚至超越集中训练效果;单纯做平均(FedAvg)容易失真,而引入化学相似度加权能显著提高泛化性;模型的鲁棒性来源于“多源+知识”,更符合真实制药环境。
启发:我觉得未来可以尝试“不确定性驱动的联邦加权”,用模型置信度来动态调整权重;也可以探索“知识图谱联邦”,把反应模板、官能团和反应家族做成图,用 GNN 做知识对齐;最后,还可以结合主动学习,让模型挑出“不确定+低相似”的分子请化学家标注,形成闭环优化。
这篇论文对我最大的启发是:做逆合成预测不仅是算法问题,更是如何让模型“懂化学”并在现实环境中安全落地的问题。

更多推荐


所有评论(0)