在黑箱和白盒之间:深入解读“热力学仿真辅助随机森林”的船舶发动机可解释故障诊断新方法
这篇文章是对2025年发表在Measurement的Thermodynamic simulation-assisted random forest: Towards explainable fault diagnosis of combustion chamber components of marine diesel engines的解读。
你是否想过,在浩瀚的大洋中,一艘巨轮的心脏——那台如小楼般巨大的柴油机——是如何被诊断和维护的?当一个关键部件出现故障时,我们如何能快速、准确,并且充满信心地找出问题所在?
这是一个困扰行业多年的难题。传统的AI诊断方法常常像一个“黑箱”,它能给出答案,却无法解释原因,这让工程师们难以完全信任。而最近,一篇发表在《Measurement》期刊上的论文,为我们提供了一个有参考价值的解决方案。
一、核心挑战:AI诊断的两大“拦路虎”
在深入了解这篇论文的方法之前,我们先来看看船舶发动机智能故障诊断所面临的两个核心问题:
(1)“病例”稀缺: 船舶发动机非常可靠,严重故障很少发生。这虽然是好事,但也意味着我们很难收集大量可供AI学习的真实故障数据。
(2)“黑箱”困境: 即使有了数据,许多先进的AI模型在做出判断后,也无法告诉我们“为什么”。它可能会说“这是活塞环磨损”,但它做出此判断的依据是什么?这个过程的不透明,是其在关键工业领域应用的障碍之一。
二、解决方案:热力学仿真辅助随机森林(TSRF)框架
该论文的一个主要特点在于,将两种不同的方法在功能层面进行了有机结合,从而在一定程度上兼顾了各自的优势。这套方法的整体框架可以由下图清晰地展示:

图 1: 热力学仿真辅助随机森林方法的整体结构
从图中我们可以看到,整个流程从热力学模型出发,通过故障仿真生成数据,经过分类,最后到达解释环节。具体来说:
(1)热力学仿真模型
它基于严谨的物理定律和工程知识,在计算机中构建了一个与真实发动机对应的“数字孪生”模型。我们期望这个模型不仅了解发动机的正常工作状态,更知道当某个零件(如缸套、活塞)出问题时,发动机的各项参数(如温度、压力、热流)会如何变化。它负责创造出大量、高质量、在现实中无法获得的“教学病例”。下图为柴油机一维热力学模型:

图2:柴油机一维热力学模型
它是一种通过计算机模拟来研究柴油机工作过程的“数字简化模型”,它介于“过于简单的公式”和“极其复杂的3D模拟”之间,是目前发动机设计和调校中最常用的工具。简单说,它是利用一维流动方程来模拟发动机内部热力学循环的计算机程序。它是发动机工程师用来平衡性能、油耗和开发效率的“模拟器”。
(2)随机森林模型
它是一个强大的AI模型,擅长从复杂数据中学习和发现规律。随机森林模型通过学习热力学仿真模型提供的大量故障案例,能够快速、准确地对不同的故障类型进行分类。
下图为结合了柴油机热力学建模与机器学习(随机森林)以及模型可解释性分析(SHAP值)的完整科学研究流程图:

图3:基于 SHAP 的参数选择过程
上图的核心步骤为:
①仿真数据生成 (Data Generation)
利用柴油机一维热力学模型进行大量仿真计算,模拟不同工况下的发动机表现,从而产生一个包含各种物理参数(如压力、温度、转速等)的原始数据集。
②初步机器学习建模 (Initial ML Training)
将原始数据集输入到随机森林 (Random Forest) 算法中进行初步训练。这一步的目的是让机器学会参数与性能指标之间复杂的非线性映射关系。
③SHAP 贡献度量化 (SHAP Explanation)
引入 SHAP 解释器对初步建立的模型进行“拆解”。它会计算每个输入参数(变量)对预测结果的影响数值(SHAP值),并明确哪些是正向影响,哪些是负向影响。
④关键参数筛选 (Parameter Selection)
根据 SHAP 值的大小对所有参数进行重要性排序。工程师通过这个排行榜,识别出对发动机性能影响最大的核心变量,并剔除那些无关紧要或贡献极小的冗余参数。
⑤模型精简与优化 (Re-identification)
利用筛选出的关键参数子集重新训练随机森林模型。这样做不仅提高了模型的计算效率,排除了多余参数的干扰,还使得模型更具物理意义,对发动机的设计调校也有一定的借鉴意义。
三、工作流程
(1)创造数据:
首先,研究人员利用热力学模型,系统地模拟了缸盖开裂、活塞烧蚀、缸套磨损等五种典型的燃烧室故障。通过微调模型参数,生成了覆盖多种故障状态的数据集,在一定程度上缓解了实际“病例”样本不足的问题
(2)智能筛选与诊断:
然后,该论文并没有将所有模拟参数都交给AI。而是使用一种名为SHAP的先进分析工具,去评估每个参数对于区分故障的重要性。这就像一位经验丰富的医生,知道要重点关注哪几项关键指标。最终,他们筛选出8个“重要指标”(如涡轮增-压器后排气温度、漏气热流等),并用这些指标来训练随机森林模型,使其诊断准确率在仿真数据集上达到了惊人的99.07%。
下图直观地展示了各个参数的重要性排序。可以看到,P14(涡轮-增压器后排气温度)、P05(缸套壁热流)和P06(漏气热流)等参数排在了前列。

图4:基于SHAP值的热力学参数重要性排序
(3)解释原因(最关键的一步):
当模型做出诊断后(例如,判断为F4故障“活塞环磨损”),研究人员再次使用SHAP工具来“反问”AI:“你为什么这么认为?” SHAP能够清晰地量化出每一个“重要指标”对最终诊断结果的贡献度。
下图就是这样一个“诊断报告”的可视化。它清晰地展示了对于一次“活塞环磨损”的诊断,各个参数是如何影响最终判断的。红色的条块代表“促进”作用,蓝色的则代表“抑制”作用。

图5:对“活塞环磨损”故障(F4)的瀑布图解释
通过这种方式,AI的诊断结果不再仅是孤立的输出,而是能够附带一定程度上基于数据与物理约束的解释信息,为工程人员理解模型决策过程提供支持。
四、研究意义
这项工作不仅致力于提升诊断的准确率,更重要的是,它通过“仿真创造数据 + AI智能诊断 + 可解释性分析” 的闭环,为解决复杂工业设备的智能维护问题提供了一套值得参考的思路。对于从事相关领域的工程师和研究人员来说,这篇论文有着一定的参考价值。
论⽂标题:Thermodynamic simulation-assisted random forest: Towards explainable fault diagnosis of combustion chamber components of marine diesel engines
刊载期刊:Measurement (Elsevier), 2025
C. Luo, M. Zhao, X. Fu, S. Zhong, S. Fu, K. Zhang, X. Yu. Thermodynamic simulation assisted random forest: Towards explainable fault diagnosis of combustion chamber components of marine diesel engines [J]. Measurement, 2025, 251: 117252
DOI:10.1016/j.measurement.2025.117252
完整资源包(包含论⽂、代码及数据):https://ts-rf.github.io/zh-CN/
更多推荐



所有评论(0)