面向对象:材料化工 · 精细化工 · 实验设计与数据团队

"如果我告诉 AI 目标性能,它能不能直接给我一个配方?"这是一个典型的逆向问题。但在多数研发现场,更常见、也更容易起步的是正向问题:给定配方、原料与工艺,能不能预测性能?

核心判断 真正可落地的"AI 给配方"不是让模型从目标一步跳到答案,而是用正向模型评估候选,用EDBO等逆向优化方法选择下一轮最值得做的实验,再用实验结果更新模型。

一、先分清两条逻辑:正向预测与逆向优化

材料配方研发可以抽象为"组成—工艺—结构—性能"的映射。AI 参与其中,至少有两条方向不同、但相互依赖的路径。

正向预测:配方与工艺 → 性能。把同一产品族的历史实验数据整理为可训练数据集,模型学习组分、原料批次、工艺参数、测试条件与性能结果之间的关系。它可以在实验前预测关键指标、排序候选方案、识别主控变量,并给出不确定度。

  • 逆向优化:目标与约束 → 候选方案。研发人员定义变量范围、性能目标、成本或法规约束,优化算法在搜索空间内提出下一批候选。多目标问题通常不会得到唯一"最优配方",而是得到一组可供权衡的 Pareto 方案。
  • 为什么逆向不能直接"反推"

这不是模型不够聪明,而是逆向问题本身的性质:满足同一组性能的配方往往有很多,而其中大部分在现实中不可行——原料买不到、工艺跑不了、成本超预算、法规不允许。缺少这些边界信息时,任何直接反推的结果都只能是假设所以现实中我们不"解"逆向问题,而是"搜"逆向问题:让正向模型充当评价函数,让优化算法在受约束的空间里搜索。

这个转换带来一个关键好处:搜索并不要求模型"知道正确答案",只要求它"能比较优劣"。后者的数据门槛低得多——这也是为什么在数据量并不大的配方体系里,这条路依然走得通。

研发逻辑

输入 → 输出

适合解决的问题

正向预测

配方、工艺 → 性能

实验前预测、候选排序、关键变量识别、给出不确定度

逆向优化

目标、约束 → 候选方案

在有限实验预算下推荐下一批实验,输出可权衡的 Pareto 方案

闭环迭代

新结果 → 模型更新 → 再推荐

持续缩小搜索空间、处理多目标权衡、逐轮提升判断可靠性

表 1|两条逻辑与闭环迭代

两者不能简单替代:正向模型只回答"这个候选可能表现怎样",不直接告诉团队应该去哪里搜索;逆向优化若没有可靠数据、明确边界和可验证的正向模型,也容易变成缺乏依据的推荐。模型的结论原则上只在训练数据覆盖的产品族与变量范围内成立;换原料体系、设备或测试方法,都需要重新验证。

二、正反向结合,才是"AI 给配方"的真实路径

一条可执行的闭环通常只有四步:

  1. 定义搜索空间

    明确可调整的组分与工艺变量(连续值如温度/pH、离散值如非连续的浓度、分类值如溶剂/配体)、变量范围、性能目标、约束条件和测试方法;

  2. 准备初始数据并初始化代理模型

    若已有历史数据,可直接导入以拟合初始代理模型(通常为高斯过程 Gaussian Process, GP);若没有历史数据,则由系统按空间填充设计(如拉丁超立方采样)生成首批实验,完成后自动建模;

  3. 进行逆向推荐

    EDBO 通过采集函数在"探索未知区域"和"利用当前优选区域"之间权衡,推荐下一批实验;

  4. 回流实验结果

    完成、审核并回传新结果,更新模型后进入下一轮。

第三步在做什么:贝叶斯优化的两个半边

贝叶斯优化之所以适合配方研发,是因为它同时用到了正反两个方向。它先用已有的少量实验拟合一个带不确定度的代理模型(通常为高斯过程 GP)——这是正向的一半,既给出预测值,也给出"这里我有多没底";再用采集函数在"预期性能高"和"信息量大"之间权衡——单目标场景常用期望改进(EI),多目标 Pareto 优化则常用预期超体积改进(EHVI, Expected Hypervolume Improvement),直接给出下一批最值得做的实验——这是逆向的一半。它不追求一次算准,而是让每一次实验尽可能减少模型的不确定性。

做法

回答什么问题

适合的数据规模

典型输出

传统 DOE

在预设的因子与水平里,哪些因素显著、如何配置

按设计表一次投若干组

效应显著性、响应面、优化区域

正向 ML 预测

任意给定配方与工艺,性能大约是多少

同一产品族数十至数百条以上

性能预测、不确定度、变量重要性

贝叶斯优化 / EDBO

下一批实验该做哪几个,才能最快逼近目标

可在较小样本量下起步并逐轮积累

下一轮实验组合、收敛过程、Pareto 方案集

表 2|DOE、正向预测与贝叶斯优化,回答的不是同一个问题

三者不是替代关系:DOE 帮助把变量与范围定清楚,正向模型把已有数据变成可复用的判断力,贝叶斯优化决定下一步往哪走。实践中常常串联使用。

  • 方法学佐证 在钯催化直接芳基化反应的公开基准研究中,贝叶斯优化在优化效率(所需实验次数)与结果稳定性两方面均优于人类专家的决策[2]。
  • 公开案例 在一项发表于 Nature Communications 的电池电解液研究中,研究团队将自动化配液与测试平台 Clio 和机器学习优化结合,在约 1000 种候选组合中完成 42 次实验、用 2 个工作日找到 6 种表现优异的快充电解液。这个案例说明的不是 AI 可以普遍"42 次给出配方",而是模型可以根据上一轮结果选择更有信息量的下一个实验点,从而减少低信息量尝试[1]。
  • 一条专业提醒 如果测试方法的重复性差于模型要分辨的性能差异,闭环会追随测量噪声,而不是收敛到更优方案。进入优化前,应先固定样品制备、仪器方法、环境条件和数据审核规则。

三、创腾科技如何把这条闭环落到产品中

闭环不是一个孤立的算法模块。它需要实验现场、数据底座和建模优化平台协同工作:

  • iLabPower:记录实验"实际发生了什么"。

    通过 ELN、DOE 等能力管理变量与水平、实验计划、样品、测试结果和审核状态;实验设计可与实验记录双向关联,保留完整追溯链。[4]

图片

图:iLabPower ELN电子实验记录本

  • SDH:把分散记录变成可训练数据。

    对来自 ELN、LIMS、仪器及历史文件的数据进行抽取、清洗、对齐和融合,统一物料、指标、单位与实验上下文,形成面向具体产品族的数据集。[5]

图片

图:SDH科学数据基因组平台

  • MaXFlow:完成正向建模与逆向优化。

    基于结构化数据训练性能预测模型;EDBO(Experimental Design based on Bayesian Optimization)可利用已有数据构建模型,在多目标 Pareto 优化中推荐下一轮实验,并随新结果迭代更新。[6]

图:MaXFlow平台EDBO数据分析工具

一条链路 iLabPower 采集与执行 → SDH 治理与融合 → MaXFlow 建模预测与 EDBO 推荐 → 实验结果回流。

这条链路把"模型建议"放回日常研发流程:研发人员仍负责定义边界、确认实验和判断是否采纳;系统负责保留依据、减少重复录入,并让每一轮结果成为下一轮决策的输入。

四、企业应该从哪一步开始

不必等到拥有所谓"大数据",但要从一个边界清楚的产品族开始。

  • 数据分散、记录条件不完整:

    先用 iLabPower 规范实验记录,再由 SDH 统一数据口径。此时不要急于要求模型给配方。

  • 已有一批同口径、可比的历史数据:

    先在 MaXFlow 做正向性能预测试点。验收重点不是训练集拟合度,而是对留出批次的误差、不确定度和适用域。

  • 变量与约束可参数化、实验周期可接受、结果能稳定回流:

    再引入 EDBO 做多轮推荐,以相同实验预算下的收敛效率和获得的有效方案数评价价值。

"小数据"可以做窄范围建模,但"小数据"不等于可以忽略数据质量。失败实验、原料批次、设备条件和测试重复性,往往比单纯增加样本数量更重要。值得强调的是,未达标与失败的实验同样要入库[3]:企业库里若只留成功配方,模型就只见过"成功长什么样",学不到边界在哪。早在 2016 年就有研究表明,把实验室笔记本里的失败反应系统整理后用于训练,模型判断成败的准确率可以超过人的经验直觉[3]。

结语:AI 减少的不是实验,而是低信息量的实验

回到最初的问题:AI 能不能自动给配方?

更准确的回答是:AI 可以用正向模型预测候选表现,用 EDBO 等逆向方法推荐下一轮实验,并在结果回流后持续优化;但它不能跳过实验验证,也不能脱离数据覆盖范围直接给出可生产的最终配方。

可靠的交付物不应只有一个配方数字,而应包括候选方案、推荐依据、不确定度、适用边界与验证计划。AI 的价值,是让有限的实验预算优先花在更有信息量的候选上。

欢迎交流:想判断您的配方研发更适合先做正向性能预测,还是进入EDBO多轮优化?欢迎联系创腾科技,我们可以结合一个具体产品、现有数据量和实验周期,协助梳理 iLabPower、SDH 与MaXFlow的试点路径。

参考资料

[1] Dave 等,Autonomous optimization of non-aqueous Li-ion battery electrolytes via robotic experimentation and machine learning coupling,Nature Communications,2022。

[2] Shields 等,Bayesian reaction optimization as a tool for chemical synthesis,Nature,2021(贝叶斯实验优化方法与 EDBO 工具的原始文献)。

[3] Raccuglia 等,Machine-learning-assisted materials discovery using failed experiments,Nature,2016。

[4] 创腾科技,iLabPower DOE 实验设计。

[5] 创腾科技,SDH 科研数据中台。

[6] 创腾科技,MaXFlow 3.10 EDBO 功能说明。

来源:创腾科技

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐