AI落地的真相:数据工程决定成败
面向正在推进或评估工业AI项目的工程师和决策者。核心论点是:决定一个AI项目成败的,不是算法的先进程度,而是数据工程的质量。在工业和边缘场景中,这一规律尤为突出,且往往以出人意料的方式显现。
一、大量AI项目失败,问题在哪里
几组独立调研,从不同角度指向同一个结论。
RAND 公司 2024 年发布的研究报告《AI项目失败的根本原因》[1],访谈了 65 位有五年以上经验的数据科学家和工程师后发现:领导层沟通不清(84% 的受访者提及)和数据问题(50 位受访者中有 30 位提及)是两大最主要的失败根因,二者合计被半数以上受访者主动提及为首要原因。一位受访工程师的原话是:
“AI 工作的 80% 是数据工程的脏活累活。你需要靠谱的人去做这些脏活——否则他们的错误会污染整个算法。难的是,如何说服优秀的人去做这些枯燥的工作。”
Gartner 在 2025 年 2 月的一份报告中给出了更具体的数字[2]:63% 的企业不确定自己是否拥有支撑 AI 的合规数据管理能力;据此,Gartner 预测到 2026 年底,60% 的 AI 项目会因为缺乏"AI就绪"的数据而被放弃。2026 年 1 月,Gartner 进一步指出,超过一半的生成式 AI 项目在完成概念验证后即被放弃[3]。
这几组数字从不同口径得出了相近的结论:卡住大多数 AI 项目的,不是算法能力,而是数据本身的可用性、质量和治理能力。这与学术竞赛(如 Kaggle)中的情况几乎相反——在那类环境里,数据已经预先清洗完毕,算法优化才是决定名次的核心变量。
二、数据工程的实际工作量
一个中型制造企业的视觉质检项目,时间分配往往如下:
数据摸底与需求调研:2周
传感器/摄像头安装调试:3周
数据采集与初步清洗:4周
建立标注规范 + 培训标注人员:2周
数据标注(5000张):4周
专家审核与纠错:2周
补充标注:3周
───────────────────────────────
合计标注相关工作:约11周,占总工期44%
模型训练与调试:2周
测试与优化:3周
这个结构告诉我们:项目的大多数时间消耗在数据上,模型训练本身只是尾声。
数据质量问题的现实形态
工业数据的常见问题,往往不是缺数据,而是数据无法直接使用:
- 时间戳不同步:不同系统的时钟可能相差数秒,跨系统关联分析时数据完全错位
- 标签在纸上:维修记录、故障原因、工艺参数变更——这些"黄金标签"大量存在于纸质表单中,无法自动提取
- 系统孤岛:ERP、MES、SCADA 分属不同部门,没有统一的设备 ID 体系,数据无法关联
- 工况标签缺失:同一台设备在不同转速、不同负载下,信号特征分布完全不同。没有工况标签,"正常数据"实际上是多个模态的混合
数据治理工作(打通孤岛、统一格式、建立元数据)往往占整个项目工期的 40%~60%,却是合同中最难定价的部分,也是最容易被低估的成本。
三、工业和边缘场景的特殊数据困境
互联网 AI 存在数据飞轮效应:用户越多,数据越多,产品越好,用户越多。这个正向循环是互联网巨头护城河的本质。
工业和边缘场景中,这个飞轮不存在,甚至逆转。
故障数据的悖论
设备的设计目标是"不出故障"。一台维护良好的工业电机,一年可能只发生 1~2 次故障。这意味着:
正常运行数据:数百万条
故障数据:个位数到几十条
这不是采集工作不到位,而是物理现实。训练一个神经网络至少需要数百个同类故障样本,而一台设备可能需要运行数十年才能积累这个量。数据增强可以一定程度上缓解这个问题,但无法从根本上解决。
标注的高壁垒
工业数据标注的困难,远超图像分类任务。以振动信号为例:
- 传感器采集到一段异常信号
- 判断是轴承外圈故障、内圈故障,还是安装松动,需要有 20 年经验的设备工程师
- 通常还需要结合设备型号、当前工况和历史维修记录
- 拆机确认往往是最终手段
这类标注的成本在几十元到几百元每条,且即便是领域专家,在同一批样本上的判断一致性也可能只有 70%。
分布漂移是持续的,不是偶发的
工业设备的运行环境在持续变化:设备磨损是正常运行就在发生的退化,原料批次不同导致信号特征不同,季节变化影响温度区间,工况随生产任务切换。
一个训练好的模型,在工业边缘场景的有效期往往只有 3~6 个月。模型需要持续更新,而更新又需要新的标注数据,形成一个工程闭环问题,而不只是算法问题。
四、AI 带来的是复杂度转移,不是复杂度消除
这是边缘 AI 工程中最重要、也最容易被忽视的认知:AI 的出现,并没有让工业项目变得更简单,而是把复杂度从一个地方搬到了另一个地方。
规则系统 vs 模型系统
AI 之前,边缘系统的核心工作是规则工程——确定阈值、设计控制逻辑。这类工作的特点是:边界清晰,失败模式可枚举,交付后系统基本稳定,任何工程师读代码都能理解系统行为。
AI 之后,规则工程没有消失,而是被数据采集基础设施、标注工程、模型训练验证、模型压缩量化等新工作全量替代,同时还增加了完全新增的工作层:
- 模型漂移监控:数据分布偏移是持续发生的,需要专门的监控系统
- 模型生命周期管理:版本控制、OTA 更新、回滚机制
- 不确定性处理:模型在什么情况下"不知道",系统如何应对
- 可解释性与合规:工业安全认证对神经网络的黑盒性质有明确限制
风险形态的变化比工作量增加更难应对
| 风险维度 | 规则系统 | 模型系统 |
|---|---|---|
| 失败可见性 | 高——规则触发有明确日志 | 低——推理失败往往无明显征兆 |
| 失败可预测性 | 高——压力测试可枚举极端情况 | 低——OOD 输入的行为无法预先穷举 |
| 维护可交接性 | 高——新工程师读代码即可接手 | 低——需要理解训练数据、历史版本、配置 |
| 运营模式 | 一次性交付,需求驱动维护 | 持续运营,数据漂移驱动更新 |
这不是批判 AI,而是澄清它的真实定位:AI 让原本做不到的事情做得到,但没有让原本做得到的事情变得更简单。
五、数据稀缺时,哪些方法真正可行
面对工业边缘场景中故障样本稀少、标注昂贵的现实,工程上并没有单一的解法,而是几条方法并行发展,成熟度也各不相同。按当前实际采用情况,大致可以分为三个层次。
已是主流生产实践:规则/统计方法与无监督异常检测
在真实产线上,目前部署最广泛的仍然是阈值规则和统计过程控制,其次是不需要故障标签的无监督方法。自编码器(Autoencoder)仅用正常数据训练,推理时重建误差大的样本被判定为异常;PatchCore 一类的方法在工业视觉质检场景中被广泛采用,以正常图像建立特征库,测试时通过相似度判断是否异常,不需要任何缺陷标注;孤立森林计算开销极小,适合资源受限的 MCU 边缘场景。
这类方法的代价是无法区分故障类型,只能给出"正常/异常"的二分结论,但胜在部署简单、可解释、不依赖故障样本,因此是目前工业现场覆盖率最高的方案。
主动学习(Active Learning)也已经是工业视觉质检的常规做法:模型标出"最不确定"的样本交由人工优先复核,而不是随机抽样标注,用有限的标注预算换取更快的模型迭代速度。这类人机协同的标注流程,在多家视觉质检供应商的产品中已是标配能力,而非实验室方法。
正在从研究走向规模化试点:物理先验与合成数据/数字孪生
物理先验是工程领域长期使用、但常被算法团队忽视的路径。以轴承故障频率为例,其特征频率可以由几何尺寸和转速直接计算:
fBPFO=n2(1−dDcosα)⋅RPM60f_{BPFO} = \frac{n}{2} \left(1 - \frac{d}{D}\cos\alpha\right) \cdot \frac{RPM}{60}fBPFO=2n(1−Ddcosα)⋅60RPM
知道这个公式,就能直接在 FFT 频谱中定位故障频率对应的能量,而不必依赖神经网络从大量数据中自行摸索这一规律。物理先验 + 少量标注样本的组合,在设备诊断领域是成熟做法,可解释性强,也更容易通过工业客户的验收。
围绕合成数据和数字孪生生成训练样本,是目前研究和试点验证都非常活跃的方向。一份 2026 年初发表、系统梳理了 2020 年以来 86 篇相关论文的综述指出[4],合成数据在预测性维护领域已从零散探索发展为一个独立的研究子方向,多家设备制造商也在利用虚拟工厂/数字孪生模型批量生成故障工况数据,用于补充稀缺的真实故障样本。但这类方法普遍存在"仿真到真实的差距"(Sim-to-Real Gap):仅用仿真数据训练的模型,在真实设备上的表现通常弱于有一定真实数据支撑的模型,因此目前更多被定位为"数据增强手段",而非独立的解决方案,需要与少量真实故障数据配合使用。
迁移学习则处于两者之间:将同型号设备在数据充足工厂积累的模型,迁移到数据稀缺的新工厂或新产线,是相对成熟、已有大量工程案例的做法;但跨型号、跨工况的迁移,效果依然不稳定,仍需要目标域的少量真实数据做微调。
仍主要处于探索和早期试点阶段:联邦学习
联邦学习的核心思路是数据不动、只交换模型参数,理论上适合多家工厂数据无法集中的场景。但需要如实说明它当前所处的阶段:联邦学习在移动端场景(如输入法词库更新)已有成熟的大规模生产部署,而在工业设备这类跨企业、跨工厂的场景中,多数仍停留在论文验证和小规模试点阶段,真正稳定运行的规模化工业案例仍然有限。
主要卡点并不在算法本身,而在工程和合作层面:不同工厂的设备型号、传感器布点、数据分布差异较大,聚合出的全局模型收敛效果不稳定;跨企业的合作协议、数据权属和收益分配机制也尚未形成通行做法。这意味着,如果选择联邦学习作为技术路径,应把它视为一个需要与商业模式设计同步推进的中期方向,而不是可以直接套用的现成方案。适用的前提条件也比较明确:至少有 5~10 台同类设备,每台设备具备树莓派级别以上的计算能力,且数据确实存在无法集中的合规或商业原因——不满足这些条件时,联邦学习的复杂度收益比通常是负的。
六、在数据不足时,什么是合理的期望
工业 AI 的一个常见失误,是把学术竞赛的表现(测试集准确率 95%+)作为工程部署的基准。在真实工业场景中,这个期望往往脱离实际。
一个更诚实的评估框架:
问题一:这个场景是否适合数据驱动方法?
- 规则完全能描述清楚的逻辑(温度超过 90°C 报警),AI 引入的是净负担
- 只有当"人无法手工定义规则,但数据中存在可学习的规律"时,AI 才发挥真正价值
问题二:数据量是否支撑任务复杂度?
- 样本少于 1000 的场景:用传统机器学习 + 特征工程,而非端到端深度学习
- 数据中等的场景:XGBoost/LightGBM 配合合理的特征工程
- 只有数据量超过 10 万,才考虑深度学习
问题三:模型性能是否可量化并持续监控?
- "准确率 90%"没有意义,"在当前生产线上,每天的漏检率低于 0.5%"才有意义
- 没有持续监控机制的模型,在部署后性能无声衰减,发现时可能已经造成大量损失
结语
工业 AI 的核心瓶颈从来不在算法,而在数据工程——如何获取、清洗、标注和持续维护有效的训练数据,以及如何在数据稀缺时找到算法和物理知识的结合点。
理解这个现实,不是为了降低对 AI 的期望,而是为了把资源和注意力放在真正决定成败的地方。把数据工程做扎实,把监控做到位,把模型的边界解释清楚,一个工程上可靠的工业 AI 系统就已经具备了核心条件。
参考文献
[1] Ryseff, J., De Bruhl, B. F., & Newberry, S. J. (2024). The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed: Avoiding the Anti-Patterns of AI. RAND Corporation, Research Report RR-A2680-1. https://www.rand.org/pubs/research_reports/RRA2680-1.html
[2] Gartner. (2025, February 26). Lack of AI-Ready Data Puts AI Projects at Risk . https://www.gartner.com/en/newsroom/press-releases/2025-02-26-lack-of-ai-ready-data-puts-ai-projects-at-risk
[3] Gartner. (2026, January 26). Why Half of GenAI Projects Fail: Avoid These 5 Mistakes. https://www.gartner.com/en/articles/genai-project-failure
[4] Nieminen, W., Gebreweld, H., Liuha, A., Nissinen, M., Verdugo, M., Mikkola, A., & Kutvonen, A. (2026). Synthetic data for predictive maintenance: A systematic review and framework for Industry 4.0 applications. Journal of Intelligent Manufacturing. https://doi.org/10.1007/s10845-026-02795-6
更多推荐

所有评论(0)