Lecture 11 AI Ethics and Future Development
·

- 问题定义 → 数据收集 → 特征提取 → 机器学习 → 系统部署
- 不断循环:若系统不达标,可微调模型、优化特征、采集新数据、甚至重新定义问题
一、AI系统主要关注问题(Concerns)
1. 主要问题(Problems)
- 数据隐私(Data Privacy)
- 数据收集偏差(Data Collection Bias)(如数据可用性问题)
- 算法偏差(Algorithm Bias)
- 评估偏差(Evaluation Bias)
- 系统安全(System Security)
- 虚假媒体(False Media,deepfake等)
- 系统能耗(Power Consumption of the System)

2. 实践应对(Practice)
- 匿名化处理(Anonymisation,是否真的有效?)
- 了解用户群体(特别是背景信息)
- 了解你的算法
- 了解你的偏好设定
- 提高系统鲁棒性
- 深度伪造检测(Deepfake Detection)
- 算法简化
- 数据隐私与联邦学习(Learning with Anonymisation, Federated Learning)
- 理想状况下,数据应集中管理,但实际分布式数据传输有泄露风险
- 本地存储数据可能导致:
- 特征定义/数据收集不一致
- 数据质量不一致
- 特征分布不一致
四、数据收集偏差(Data Collection Bias)
- 机器学习的核心目标是建立两个特征空间之间的映射(如标签空间与数据空间)
- 标签空间和数据空间都应被描述为概率分布
- 理想中训练集可估算真实概率分布,但实际上训练集总是与真实分布有偏差(data bias)
- 如何构建好数据集?
- 覆盖足够的多样性(variety)与数量
- 如果无法覆盖所有情况?
- 不同场景就是不同领域,可用领域泛化/领域自适应(Domain Generalisation/Adaptation)
- 数据量不足可用少样本学习(Few-shot/First-shot/Zero-shot learning)
五、算法偏差(Algorithm Bias)
- 选择任何算法都隐含假设,例如:
- GMM假设所有聚类可用高斯分布近似
- SVM假设有线性可分特征空间(linear boundary)
- 朴素贝叶斯假设各特征相互独立
- 需确保算法假设与实际问题相匹配
六、评估偏差(Evaluation Bias)
1. 指标偏差
- 准确率(Accuracy):realted to overall performance,适用于类别平衡的数据。
- 精确率(Precision):quality of positive prediction(即被判为正的样本中有多少是真的正类)。
- 召回率(Recall):ability of identify positive class(即实际正类中有多少被识别出来)。
不同任务选用不同指标会造成评估结果的偏差。
2. 距离度量偏差
- 欧氏距离(Euclidean distance):度量绝对距离(两点间的直线距离)。
- 余弦距离(Cosine distance):度量方向相似性,关注角度而非距离大小,适合高维空间如文本表示。measure directional distance
- 相关距离(Correlation distance):度量时间序列等的相关性,关注两组数据随时间变化的关系。measure temporal distance
七、系统安全(System Security)
- AI系统易被攻击,方式包括:
- 加入微小的不可见噪声(扰动,Perturbation)
- 数据投毒(Data poisoning),向数据集中添加恶意样本
- 对抗样本能让分类器或语音识别系统出错
八、深度伪造(Deepfake)
- Deepfake流水线:人脸检测与裁剪、关键点检测、3D参数建模、生成与混合
- 伪造技术可实现换脸/动作复刻等,带来伦理与安全问题
九、系统能耗(Power Consumption, Environment Friendly)
- AI系统特别是深度学习模型,消耗巨大电力
- AlphaGo能耗远大于人脑
- 需尽量简化算法,降低资源消耗
十、未来挑战与应对技术(Future Challenges & Techniques)

主要挑战(Problems)
- 特征分布随环境变化
- 数据不均衡
- 数据稀缺
- 验证集出现新类别
- 新环境自适应
典型技术(Techniques)
- 领域泛化/领域自适应(Domain Generalisation/Adaptation)、迁移学习
- 少样本学习/异常检测/首样本学习/零样本学习(Few-shot/First-shot/Zero-shot Learning)
- Open set识别
十一、未来方向(Future Directions)
- 可解释AI(Explainable AI, XAI):用LIME、SHAP等工具追溯偏差来源
- 法规框架(Regulatory Frameworks):如欧盟AI法案
- 伦理设计(Ethics-by-Design):AI全流程嵌入偏差审查和公平性工具
- 设计AI时,关键问题不是机器能不能思考,而是人类能否让机器遵循伦理思考

- 数据收集是AI系统的起点。数据在被采集后,需要通过审计(Auditing),以检测和消除偏差等问题。
- 如果发现数据中存在偏差,可以采用缓解措施(Mitigation)加以解决。
- 训练过程将偏差可能放大(Amplifies),最终体现在算法本身。
- 偏差缓解贯穿整个流程。可以在数据收集、训练或部署阶段采取措施。
- 公平性工具(Fairness Tools)和可解释性(Explainability)技术可以协助识别和修正偏差。
更多推荐

所有评论(0)