深度学习预备知识
一、相关职业需求
深度学习应用工程师
1. 熟练掌握机器学习理论与实践技能。
2. 熟悉CNN等深度学习模型的使用场景,以及物体检测、图像分类等常见模型。
3. 掌握Python编程,熟悉PyTorch、TensorFlow等至少一种主流深度学习框架。
4. 具备扎实的数学与编程功底,拥有良好团队合作能力。
AI算法工程师
1. 掌握计算机视觉、图像处理基本算法及常用深度学习算法,在GAN、扩散模型、图像生成、多模态等至少一个方向有深入研究。
2. 具备扎实编程功底,熟悉PyTorch等框架,熟练使用C++/Python至少一种编程语言,了解Linux开发环境。
3. 拥有良好学习能力、创新思维,沟通协作能力强,工作主动,自驱力足。
4. 具备优秀的问题分析与解决能力,有AIGC相关产品落地经验者优先。
二、工业文明与人工智能发展
人类工业文明演变
1. 机械化时代:18世纪末,瓦特发明蒸汽机,工业设备开始发展。
2. 电气化时代:19世纪末,爱迪生发明电灯,电力开始广泛使用。
3. 信息化时代:20世纪50年代中期,电子信息技术与自动化技术兴起。
4. 人工智能时代:21世纪至今,智能系统成为核心标志。
人工智能定义
人工智能:通过人工方法在计算机上实现的类人智能。
人工智能学科:研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的技术科学。
三、人工智能与机器学习的日常应用
日常生活中的人工智能
家居场景:智能语音闹钟、灯光控制系统。
交通与办公:自动驾驶、人脸识别考勤。
消费场景:人脸支付、商品推荐、智能物流、仓储机器人、智慧购物、智慧试衣。
信息服务:短视频推荐、搜索排序、新闻推荐、智能助手、智能语音、图像编辑与美图。
设备安全:指纹、人脸识别解锁。
日常生活中的机器学习案例
语音识别系统(如小爱、Siri):先采集含大量音频样本的数据集,标注含与不含唤醒词的样本;再设计由参数决定的算法,通过数据集确定“最佳参数集”,使模型按性能度量完成任务。
核心概念:参数类似调节程序行为的“旋钮”;调整参数后的程序为“模型”,所有不同模型的集合是“模型族”;用数据集选参数的元程序叫“学习算法”。
四、机器学习核心知识
典型训练过程
1. 从随机初始化参数的“无智能”模型开始。
2. 获取带标签的数据样本(如音频片段及“是/否”标签)。
3. 调整参数,提升模型在样本中的表现。
4. 重复步骤2-3,直至模型表现达标。
关键组件
1. 数据
构成:由独立同分布的样本组成,每个样本含特征(属性),图像数据中单张照片为样本,像素数值序列为特征。
要求:数据量充足且质量合格,可减少对预设假设的依赖,训练更强模型。
常见数据集:图像类(微软COCO、ImageNet、中国交通标志牌数据集TT10OK)、视频类(YouTube-8M)、文本类(Yelp评论)、音频类(LibriSpeech)。
2. 模型:调整参数后的程序,深度学习模型由神经网络交织而成,包含多层数据转换。
3. 目标函数
定义:量化模型有效性的可优化度量,常通过最小化“损失函数”实现优化。
常见类型:回归任务用平方误差(预测值与实际值差的平方);分类任务用错误率(预测与实际不符的样本比例)。
数据集划分:训练数据集(拟合模型参数)、测试数据集(评估模型性能)。
4. 优化算法:搜索最佳参数以最小化损失函数的方法,深度学习中主流算法多基于梯度下降——通过微调参数观察损失变化,向损失减少的方向优化。
机器学习类型
1. 监督学习
核心:根据“特征-标签”样本,学习从输入特征到标签的映射。
常见任务:回归(预测数值,如房价预测)、分类(预测类别,如猫狗识别(二分类)、手写数字识别(多分类))、多标签分类(预测不互斥类别,如多目标检测)。
2. 无监督学习:处理无标签数据,包括聚类、主成分分析、因果关系与概率图模型、生成对抗网络等。
3. 强化学习:智能体通过与环境交互(接收观测→选择动作→获得奖励)持续学习优化,区别于离线学习(预先获取数据,学习时与环境断开)。
五、深度学习发展与成功案例
发展动力
数据:21世纪高速互联网、智能设备普及,形成海量数据池。
算力:廉价高质量传感器、数据存储及计算资源(尤其是GPU)普及,支撑大规模计算。
成功领域与案例
1. 图像相关:图像分类(2012年深度学习首次将ImageNet错误率降至25%以下,2017年多数团队错误率低于5%)、目标检测与分割、人脸合成、图像描述、涂鸦生成现实风景。
2. 语言相关:机器翻译(Google Translate优化)、自然语言文本合成、语音识别(错误率显著下降,实现人类对等水平)。
3. 其他领域:推荐系统(个性化推荐)、序列问题(语音识别、机器翻译等)、脑机接口(意念控制机器臂、疲劳监测)、华智冰(AI数字人)、自动驾驶(加州允许销售)。
发展里程碑
2012年:谷歌大脑神经网络从YouTube视频中识别猫。
2013年:word2vec引入上下文语义,语音识别错误率降25%。
2014年:提出GAN网络,Skype实现实时语音翻译,聊天机器人通过图灵测试。
2015年:ResNet(1000层)击败人类图像识别准确度,YOLO实现实时目标检测。
2016年:AlphaGo战胜围棋专业选手,Gmail实现智能回复。
2017年:AlphaGo Zero自学围棋,引入TPU,胶囊网修复CNN缺陷。
六、关键概念与工具
图灵测试
提出者:艾伦·麦席森·图灵(英国数学家,计算机科学与人工智能之父)。
规则:测试者通过问答,若无法在长时间内判断对方是人还是机器,或机器导致超30%误判,则认为机器具有人类智能。
更多推荐


所有评论(0)