AI能不能自动给配方?当DOE束手无策,当正向ML陷入瓶颈:你的下一阶段研发必须引入贝叶斯优化
面向对象:材料化工 · 精细化工 · 实验设计与数据团队
"如果我告诉 AI 目标性能,它能不能直接给我一个配方?"这是一个典型的逆向问题。但在多数研发现场,更常见、也更容易起步的是正向问题:给定配方、原料与工艺,能不能预测性能?
核心判断 真正可落地的"AI 给配方"不是让模型从目标一步跳到答案,而是用正向模型评估候选,用EDBO等逆向优化方法选择下一轮最值得做的实验,再用实验结果更新模型。
一、先分清两条逻辑:正向预测与逆向优化
材料配方研发可以抽象为"组成—工艺—结构—性能"的映射。AI 参与其中,至少有两条方向不同、但相互依赖的路径。
正向预测:配方与工艺 → 性能。把同一产品族的历史实验数据整理为可训练数据集,模型学习组分、原料批次、工艺参数、测试条件与性能结果之间的关系。它可以在实验前预测关键指标、排序候选方案、识别主控变量,并给出不确定度。
- 逆向优化:目标与约束 → 候选方案。研发人员定义变量范围、性能目标、成本或法规约束,优化算法在搜索空间内提出下一批候选。多目标问题通常不会得到唯一"最优配方",而是得到一组可供权衡的 Pareto 方案。
- 为什么逆向不能直接"反推"
这不是模型不够聪明,而是逆向问题本身的性质:满足同一组性能的配方往往有很多,而其中大部分在现实中不可行——原料买不到、工艺跑不了、成本超预算、法规不允许。缺少这些边界信息时,任何直接反推的结果都只能是假设。所以现实中我们不"解"逆向问题,而是"搜"逆向问题:让正向模型充当评价函数,让优化算法在受约束的空间里搜索。
这个转换带来一个关键好处:搜索并不要求模型"知道正确答案",只要求它"能比较优劣"。后者的数据门槛低得多——这也是为什么在数据量并不大的配方体系里,这条路依然走得通。
|
研发逻辑 |
输入 → 输出 |
适合解决的问题 |
|---|---|---|
| 正向预测 |
配方、工艺 → 性能 |
实验前预测、候选排序、关键变量识别、给出不确定度 |
| 逆向优化 |
目标、约束 → 候选方案 |
在有限实验预算下推荐下一批实验,输出可权衡的 Pareto 方案 |
| 闭环迭代 |
新结果 → 模型更新 → 再推荐 |
持续缩小搜索空间、处理多目标权衡、逐轮提升判断可靠性 |
表 1|两条逻辑与闭环迭代
两者不能简单替代:正向模型只回答"这个候选可能表现怎样",不直接告诉团队应该去哪里搜索;逆向优化若没有可靠数据、明确边界和可验证的正向模型,也容易变成缺乏依据的推荐。模型的结论原则上只在训练数据覆盖的产品族与变量范围内成立;换原料体系、设备或测试方法,都需要重新验证。
二、正反向结合,才是"AI 给配方"的真实路径
一条可执行的闭环通常只有四步:
- 定义搜索空间
明确可调整的组分与工艺变量(连续值如温度/pH、离散值如非连续的浓度、分类值如溶剂/配体)、变量范围、性能目标、约束条件和测试方法;
- 准备初始数据并初始化代理模型
若已有历史数据,可直接导入以拟合初始代理模型(通常为高斯过程 Gaussian Process, GP);若没有历史数据,则由系统按空间填充设计(如拉丁超立方采样)生成首批实验,完成后自动建模;
- 进行逆向推荐
EDBO 通过采集函数在"探索未知区域"和"利用当前优选区域"之间权衡,推荐下一批实验;
- 回流实验结果
完成、审核并回传新结果,更新模型后进入下一轮。
第三步在做什么:贝叶斯优化的两个半边
贝叶斯优化之所以适合配方研发,是因为它同时用到了正反两个方向。它先用已有的少量实验拟合一个带不确定度的代理模型(通常为高斯过程 GP)——这是正向的一半,既给出预测值,也给出"这里我有多没底";再用采集函数在"预期性能高"和"信息量大"之间权衡——单目标场景常用期望改进(EI),多目标 Pareto 优化则常用预期超体积改进(EHVI, Expected Hypervolume Improvement),直接给出下一批最值得做的实验——这是逆向的一半。它不追求一次算准,而是让每一次实验尽可能减少模型的不确定性。
|
做法 |
回答什么问题 |
适合的数据规模 |
典型输出 |
|---|---|---|---|
| 传统 DOE |
在预设的因子与水平里,哪些因素显著、如何配置 |
按设计表一次投若干组 |
效应显著性、响应面、优化区域 |
| 正向 ML 预测 |
任意给定配方与工艺,性能大约是多少 |
同一产品族数十至数百条以上 |
性能预测、不确定度、变量重要性 |
| 贝叶斯优化 / EDBO |
下一批实验该做哪几个,才能最快逼近目标 |
可在较小样本量下起步并逐轮积累 |
下一轮实验组合、收敛过程、Pareto 方案集 |
表 2|DOE、正向预测与贝叶斯优化,回答的不是同一个问题
三者不是替代关系:DOE 帮助把变量与范围定清楚,正向模型把已有数据变成可复用的判断力,贝叶斯优化决定下一步往哪走。实践中常常串联使用。
- 方法学佐证 在钯催化直接芳基化反应的公开基准研究中,贝叶斯优化在优化效率(所需实验次数)与结果稳定性两方面均优于人类专家的决策[2]。
- 公开案例 在一项发表于 Nature Communications 的电池电解液研究中,研究团队将自动化配液与测试平台 Clio 和机器学习优化结合,在约 1000 种候选组合中完成 42 次实验、用 2 个工作日找到 6 种表现优异的快充电解液。这个案例说明的不是 AI 可以普遍"42 次给出配方",而是模型可以根据上一轮结果选择更有信息量的下一个实验点,从而减少低信息量尝试[1]。
- 一条专业提醒 如果测试方法的重复性差于模型要分辨的性能差异,闭环会追随测量噪声,而不是收敛到更优方案。进入优化前,应先固定样品制备、仪器方法、环境条件和数据审核规则。
三、创腾科技如何把这条闭环落到产品中
闭环不是一个孤立的算法模块。它需要实验现场、数据底座和建模优化平台协同工作:
- iLabPower:记录实验"实际发生了什么"。
通过 ELN、DOE 等能力管理变量与水平、实验计划、样品、测试结果和审核状态;实验设计可与实验记录双向关联,保留完整追溯链。[4]

图:iLabPower ELN电子实验记录本
- SDH:把分散记录变成可训练数据。
对来自 ELN、LIMS、仪器及历史文件的数据进行抽取、清洗、对齐和融合,统一物料、指标、单位与实验上下文,形成面向具体产品族的数据集。[5]

图:SDH科学数据基因组平台
- MaXFlow:完成正向建模与逆向优化。
基于结构化数据训练性能预测模型;EDBO(Experimental Design based on Bayesian Optimization)可利用已有数据构建模型,在多目标 Pareto 优化中推荐下一轮实验,并随新结果迭代更新。[6]

图:MaXFlow平台EDBO数据分析工具
一条链路 iLabPower 采集与执行 → SDH 治理与融合 → MaXFlow 建模预测与 EDBO 推荐 → 实验结果回流。
这条链路把"模型建议"放回日常研发流程:研发人员仍负责定义边界、确认实验和判断是否采纳;系统负责保留依据、减少重复录入,并让每一轮结果成为下一轮决策的输入。
四、企业应该从哪一步开始
不必等到拥有所谓"大数据",但要从一个边界清楚的产品族开始。
- 数据分散、记录条件不完整:
先用 iLabPower 规范实验记录,再由 SDH 统一数据口径。此时不要急于要求模型给配方。
- 已有一批同口径、可比的历史数据:
先在 MaXFlow 做正向性能预测试点。验收重点不是训练集拟合度,而是对留出批次的误差、不确定度和适用域。
- 变量与约束可参数化、实验周期可接受、结果能稳定回流:
再引入 EDBO 做多轮推荐,以相同实验预算下的收敛效率和获得的有效方案数评价价值。
"小数据"可以做窄范围建模,但"小数据"不等于可以忽略数据质量。失败实验、原料批次、设备条件和测试重复性,往往比单纯增加样本数量更重要。值得强调的是,未达标与失败的实验同样要入库[3]:企业库里若只留成功配方,模型就只见过"成功长什么样",学不到边界在哪。早在 2016 年就有研究表明,把实验室笔记本里的失败反应系统整理后用于训练,模型判断成败的准确率可以超过人的经验直觉[3]。
结语:AI 减少的不是实验,而是低信息量的实验
回到最初的问题:AI 能不能自动给配方?
更准确的回答是:AI 可以用正向模型预测候选表现,用 EDBO 等逆向方法推荐下一轮实验,并在结果回流后持续优化;但它不能跳过实验验证,也不能脱离数据覆盖范围直接给出可生产的最终配方。
可靠的交付物不应只有一个配方数字,而应包括候选方案、推荐依据、不确定度、适用边界与验证计划。AI 的价值,是让有限的实验预算优先花在更有信息量的候选上。
欢迎交流:想判断您的配方研发更适合先做正向性能预测,还是进入EDBO多轮优化?欢迎联系创腾科技,我们可以结合一个具体产品、现有数据量和实验周期,协助梳理 iLabPower、SDH 与MaXFlow的试点路径。
参考资料
[1] Dave 等,Autonomous optimization of non-aqueous Li-ion battery electrolytes via robotic experimentation and machine learning coupling,Nature Communications,2022。
[2] Shields 等,Bayesian reaction optimization as a tool for chemical synthesis,Nature,2021(贝叶斯实验优化方法与 EDBO 工具的原始文献)。
[3] Raccuglia 等,Machine-learning-assisted materials discovery using failed experiments,Nature,2016。
[4] 创腾科技,iLabPower DOE 实验设计。
[5] 创腾科技,SDH 科研数据中台。
[6] 创腾科技,MaXFlow 3.10 EDBO 功能说明。
来源:创腾科技
更多推荐

所有评论(0)