• 问题定义 → 数据收集 → 特征提取 → 机器学习 → 系统部署
  • 不断循环:若系统不达标,可微调模型、优化特征、采集新数据、甚至重新定义问题

一、AI系统主要关注问题(Concerns

1. 主要问题(Problems

  • 数据隐私(Data Privacy)
  • 数据收集偏差(Data Collection Bias)(如数据可用性问题)
  • 算法偏差(Algorithm Bias)
  • 评估偏差(Evaluation Bias)
  • 系统安全(System Security)
  • 虚假媒体(False Media,deepfake等)
  • 系统能耗(Power Consumption of the System)

2. 实践应对(Practice

  • 匿名化处理(Anonymisation,是否真的有效?)
  • 了解用户群体(特别是背景信息)
  • 了解你的算法
  • 了解你的偏好设定
  • 提高系统鲁棒性
  • 深度伪造检测(Deepfake Detection)
  • 算法简化

  1. 数据隐私与联邦学习(Learning with Anonymisation, Federated Learning

  • 理想状况下,数据应集中管理,但实际分布式数据传输有泄露风险
  • 本地存储数据可能导致:
    • 特征定义/数据收集不一致
    • 数据质量不一致
    • 特征分布不一致

四、数据收集偏差(Data Collection Bias

  • 机器学习的核心目标是建立两个特征空间之间的映射(如标签空间与数据空间)
  • 标签空间和数据空间都应被描述为概率分布
  • 理想中训练集可估算真实概率分布,但实际上训练集总是与真实分布有偏差(data bias)
  • 如何构建好数据集?
    • 覆盖足够的多样性(variety)与数量

  • 如果无法覆盖所有情况?
    • 不同场景就是不同领域,可用领域泛化/领域自适应(Domain Generalisation/Adaptation)
    • 数据量不足可用少样本学习(Few-shot/First-shot/Zero-shot learning)

五、算法偏差(Algorithm Bias

  • 选择任何算法都隐含假设,例如:
    • GMM假设所有聚类可用高斯分布近似
    • SVM假设有线性可分特征空间(linear boundary)
    • 朴素贝叶斯假设各特征相互独立
  • 需确保算法假设与实际问题相匹配

六、评估偏差(Evaluation Bias

1. 指标偏差

  • 准确率(Accuracy):realted to overall performance,适用于类别平衡的数据。
  • 精确率(Precision):quality of positive prediction(即被判为正的样本中有多少是真的正类)。
  • 召回率(Recall):ability of identify positive class(即实际正类中有多少被识别出来)。

不同任务选用不同指标会造成评估结果的偏差。

2. 距离度量偏差

  • 欧氏距离(Euclidean distance):度量绝对距离(两点间的直线距离)。
  • 余弦距离(Cosine distance):度量方向相似性,关注角度而非距离大小,适合高维空间如文本表示。measure directional distance
  • 相关距离(Correlation distance):度量时间序列等的相关性,关注两组数据随时间变化的关系。measure temporal distance

七、系统安全(System Security

  • AI系统易被攻击,方式包括:
    • 加入微小的不可见噪声(扰动,Perturbation)
    • 数据投毒(Data poisoning),向数据集中添加恶意样本
  • 对抗样本能让分类器或语音识别系统出错

八、深度伪造(Deepfake

  • Deepfake流水线:人脸检测与裁剪、关键点检测、3D参数建模、生成与混合
  • 伪造技术可实现换脸/动作复刻等,带来伦理与安全问题

九、系统能耗(Power Consumption, Environment Friendly

  • AI系统特别是深度学习模型,消耗巨大电力
    • AlphaGo能耗远大于人脑
  • 需尽量简化算法,降低资源消耗

十、未来挑战与应对技术(Future Challenges & Techniques

主要挑战(Problems

  • 特征分布随环境变化
  • 数据不均衡
  • 数据稀缺
  • 验证集出现新类别
  • 新环境自适应

典型技术(Techniques

  • 领域泛化/领域自适应(Domain Generalisation/Adaptation)、迁移学习
  • 少样本学习/异常检测/首样本学习/零样本学习(Few-shot/First-shot/Zero-shot Learning)
  • Open set识别

十一、未来方向(Future Directions

  • 可解释AI(Explainable AI, XAI):用LIME、SHAP等工具追溯偏差来源
  • 法规框架(Regulatory Frameworks):如欧盟AI法案
  • 伦理设计(Ethics-by-Design):AI全流程嵌入偏差审查和公平性工具
  • 设计AI时,关键问题不是机器能不能思考,而是人类能否让机器遵循伦理思考

  • 数据收集是AI系统的起点。数据在被采集后,需要通过审计(Auditing),以检测和消除偏差等问题。
  • 如果发现数据中存在偏差,可以采用缓解措施(Mitigation)加以解决。

  • 训练过程将偏差可能放大(Amplifies),最终体现在算法本身。

  • 偏差缓解贯穿整个流程。可以在数据收集、训练或部署阶段采取措施。
  • 公平性工具(Fairness Tools)可解释性(Explainability)技术可以协助识别和修正偏差。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐