在当今数字化浪潮席卷全球的时代,人工智能无疑是最引人瞩目的领域之一,而深度学习作为人工智能的核心技术,正深刻改变着我们的生活与工作。

一、人类工业文明演变:人工智能时代的到来

回顾人类工业文明的发展历程,我们能清晰地看到技术进步推动社会变革的轨迹。

  1. 机械化时代(18 世纪末):瓦特发明蒸汽机,标志着人类进入机械化时代,工业设备开始逐步发展,极大地提高了生产效率,改变了传统的生产方式。
  1. 电气化时代(19 世纪末):爱迪生发明电灯,电力开始广泛使用,为工业生产和人们的生活带来了巨大变革,推动了各类电器设备的发明与应用。
  1. 信息化时代(20 世纪 50 年代中期):电子信息技术和自动化技术迅速发展,计算机、互联网等技术逐渐普及,使得信息的传递与处理更加便捷高效,深刻改变了人们的生活和工作模式。
  1. 人工智能时代(21 世纪至今):随着智能系统的不断发展与完善,人工智能技术逐渐渗透到各个领域,从日常生活到工业生产,从医疗健康到交通运输,都能看到人工智能的身影,开启了人类文明的全新篇章。

二、人工智能:概念、影响与生活应用

(一)人工智能的定义

人工智能,简单来说,就是用人工的方法在机器(计算机)上实现的智能,或者说人们使机器具有类似于人的智能。而人工智能学科,则是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门技术科学。值得注意的是,计算器并不属于人工智能,它只是按照预设程序进行简单的数值计算,不具备自主学习和智能决策的能力。

(二)人工智能带来的生活方式转变

人工智能技术正深刻改变着我们的生活方式,各种智能产品和服务层出不穷:

  • 日常起居:智能语音闹钟可以根据我们的作息时间,用自然的语音唤醒我们;灯光控制系统能够根据环境光线和我们的需求,自动调节灯光亮度和颜色,为我们营造舒适的居住环境。
  • 出行方式:自动驾驶技术正在逐步发展和应用,未来有望大幅提高出行的安全性和便捷性,减少交通事故的发生。
  • 工作办公:人脸识别考勤系统取代了传统的打卡方式,提高了考勤的准确性和效率,避免了代打卡等问题。
  • 购物消费:智能购物系统能根据我们的消费习惯和偏好,为我们推荐合适的商品;智慧衣帽间可以通过智能技术,帮助我们挑选搭配衣物;人脸支付则让支付过程更加便捷快速,无需携带现金或银行卡。
  • 医疗健康:智慧医疗通过人工智能技术,实现了疾病的早期诊断、精准治疗和健康管理,提高了医疗服务的质量和效率。
  • 信息获取与娱乐:商品推荐、短视频推荐、搜索排序、新闻推荐等技术,能根据我们的兴趣爱好,为我们精准推送相关信息和内容;智能助手、智能语音能为我们提供便捷的服务,如查询天气、设置提醒等;图像编辑、智能美图等工具则满足了我们对图像美化的需求。

三、机器学习:深度学习的基础

(一)日常生活中的机器学习

机器学习在我们的日常生活中无处不在,只是我们可能没有察觉。比如判断天气的好坏,我们会根据以往的天气经验、云层状况、温度、湿度等因素进行判断,这其实就类似于机器学习的过程;挑选西瓜时,我们会根据西瓜的外观(如颜色、纹路)、敲击声音等特征来判断西瓜的好坏,这也是一种简单的机器学习应用。

语音识别系统(如小爱、Siri)是机器学习在日常生活中的典型应用。其实现过程主要包括:首先采集大量包含唤醒词和不包含唤醒词的音频样本数据集,并对这些样本进行标注;然后设计一个灵活的程序算法,该算法的输出由许多参数决定;最后使用标注好的数据集来确定 “最佳参数集”,使算法在识别唤醒词的任务中达到最佳性能。

(二)机器学习的关键概念

  1. 参数与模型:参数可以被看作旋钮,通过调整参数可以改变程序的行为。任一调整参数后的程序被称为模型,而通过操作参数生成的所有不同程序的集合则称为 “模型族”。
  1. 学习算法:使用数据集来选择参数的元程序被称为学习算法。

(三)典型训练过程

机器学习模型的典型训练过程通常包括以下几个步骤:

  1. 从一个随机初始化参数的模型开始,此时的模型基本没有 “智能”,无法准确完成任务。
  1. 获取一些数据样本(例如,音频片段以及对应的是否为唤醒词的标签),这些样本将用于训练模型。
  1. 调整模型的参数,使模型在这些样本中的表现更好,即减少模型的预测误差。
  1. 重复步骤 2 和步骤 3,不断使用新的数据样本调整模型参数,直到模型在任务中的表现达到令人满意的程度。

(四)机器学习中的关键组件

无论是什么类型的机器学习问题,都会涉及以下四个关键组件:

  1. 数据(data):数据是机器学习的基础,每个数据集由一个个样本组成,大多数情况下样本遵循独立同分布。样本有时也被称为数据点或数据实例,通常每个样本由一组称为特征(features,或协变量(covariates))的属性组成。
  • 当处理图像数据时,每一张单独的照片就是一个样本,其特征由每个像素数值的有序列表示。
  • 拥有更多的数据有助于训练出更强大的模型,减少对预先设想假设的依赖。但仅仅拥有海量数据是不够的,还需要确保数据的质量和相关性,即拥有 “正确的数据”。
  • 常见的数据集有很多,如微软 COCO(包含 33 万张图片,80 个对象类别)、ImageNet(包含 1400 多万幅图片,涵盖 2 万多个类别)、中国交通标志牌数据集 TT10OK(包含 10 万张图像,221 个种类别)、YouTube-8M(包含 610 万个视频、3862 个类别)、Yelp 评论(包含 500 万条 Yelp 评论)、LibriSpeech(包含 1000 小时阅读英语演讲)等。
  1. 模型(model):任一调整参数后的程序被称为模型。在深度学习中,这些模型由神经网络错综复杂地交织在一起,包含层层数据转换,这也是 “深度学习” 名称的由来。
  2. 目标函数(objective function):“学习” 的本质是自主提高模型完成某些任务的效能,而目标函数就是用来量化模型效能的度量,且在大多数情况下是 “可优化” 的。
  • 定义一个目标函数,并将其优化到最小值,此时的目标函数被称为损失函数。
  • 在预测数值任务(如房价预测)中,常用的损失函数是平方误差,即预测值与实际值之差的平方;在预测分类任务(如猫狗识别)中,常用的是最小化错误率,即预测与实际情况不符的样本比例。
  • 损失函数是根据模型参数定义的,并取决于数据集。在一个数据集上,我们可以通过最小化总损失来学习模型参数的最佳值。
  • 数据集通常分为训练数据集和测试数据集,训练数据集用于拟合模型参数,测试数据集用于评估拟合后的模型性能。
  1. 算法(algorithm):当我们拥有数据源及其表示、模型和合适的损失函数后,就需要一种算法来搜索最佳参数,以最小化损失函数。在深度学习中,大多数流行的优化算法基于梯度下降(gradient descent)。
  • 梯度下降法的基本原理是:在每个步骤中,检查每个参数,判断如果仅对该参数进行少量变动,训练集损失会朝哪个方向移动,然后在可以减少损失的方向上优化参数。

(五)机器学习的主要类型

  1. 监督学习
  • 定义:监督学习擅长在 “给定输入特征” 的情况下预测标签,每个 “特征 - 标签” 对称为一个样本,目标是生成一个能将任何输入特征映射到标签(即预测)的模型。
  • 学习过程:将训练输入和对应的训练标签输入到模型中,模型通过学习这些数据,建立输入特征与标签之间的映射关系,最终能够根据新的输入特征输出预测结果。
    • 主要任务:
  • 回归:回归是最简单的监督学习任务之一,例如房价预测。判断一个任务是否为回归问题,本质上由输出决定。如果标签取任意数值,那么该任务就是回归问题,目标是生成一个模型,使其预测值非常接近实际标签值,常用的损失函数是平方误差损失函数。
  • 分类:分类问题是预测样本属于 “哪一类” 的问题,例如猫狗识别(二项分类)、手写数字识别(多项分类)。分类任务的目标是训练一个分类器,使其能够输出预测的类别,常用的损失函数是交叉熵。
  • 标注问题:学习预测不相互排斥的类别的问题称为多标签分类,例如多目标检测、短视频分类。在这类问题中,一个样本(如一张图片或一个候选框)可能含有多个物体,标注的标签也是多个的,且多个类别之间并不是互斥的。
  1. 推荐系统:推荐系统的目标是向特定用户进行 “个性化” 推荐。例如,在电影推荐中,科幻迷和喜剧爱好者看到的推荐结果页面会有很大不同,它会根据用户的历史行为、兴趣偏好等数据,为用户推荐可能感兴趣的内容。
  2. 序列问题:序列问题的输入和输出都是可变长度的序列,常见的应用包括标记和解析、自动语音识别、文本到语音、机器翻译等。
  3. 无监督学习:无监督学习是指数据中不含有标签的机器学习问题,主要包括聚类问题、主成分分析问题、因果关系和概率图模型、生成对抗网络等。在无监督学习中,模型需要从无标签的数据中自主发现数据的内在规律和结构。
  1. 强化学习
  • 定义:强化学习中,智能体在一系列的时间步骤上与环境交互。在每个特定时间点,智能体从环境接收一些观察,然后选择一个动作并通过某种机制(如执行器)传输回环境,最后从环境中获得奖励。之后新一轮循环开始,智能体接收后续观察,选择后续操作,依此类推。
  • 与离线学习的区别:之前提到的监督学习和无监督学习大多属于离线学习,即预先获取大量数据,然后启动模型,不再与环境交互。而强化学习则是智能体与环境持续交互,通过不断尝试和获得奖励来学习最优策略,能够解决更复杂、动态变化的问题,但学习过程相对复杂。

四、深度学习的发展与成功案例

(一)深度学习的发展背景

21 世纪以来,随着高速互联网的普及,智能手机摄像头、视频游戏等照片共享网站的兴起,大量的数据被产生和积累,数据池逐渐被填满。同时,廉价又高质量的传感器、廉价的数据存储以及廉价计算(特别是 GPU 的普及)的出现,使得大规模的算力变得唾手可得,这些都为深度学习的快速发展提供了坚实的基础。

(二)深度学习的成功领域与案例

  1. 图像分类:在 ImageNet 大规模视觉识别挑战赛中,深度学习展现出了卓越的性能。在比赛的第一年,所有团队的错误率都至少在 25% 以上;2012 年,首个使用深度学习的团队将错误率降至 25% 以下;此后,越来越多的团队采用深度学习技术,到 2013 年,几乎所有团队的错误率都在 25% 或以下;2017 年,38 支参赛团队中有 29 支的错误率低于 5%,充分体现了深度学习在图像分类领域的巨大优势。
  1. 目标检测和分割:深度学习能够准确地检测图像中的目标物体,并对目标进行分割,为自动驾驶、安防监控、医学影像分析等领域提供了重要的技术支持。例如,在自动驾驶中,目标检测和分割技术可以帮助车辆识别行人、其他车辆、交通信号灯、道路标志等,保障行车安全。
  1. 人脸合成:通过深度学习技术,可以生成高度逼真的人脸图像,在影视制作、游戏开发、虚拟现实等领域有广泛的应用前景。
  1. 机器翻译:以 Google Translate 为例,深度学习技术的应用使其翻译质量得到了显著提升。对比旧版和新版的翻译结果,新版翻译更加准确、流畅,更符合目标语言的表达习惯,大大提高了跨语言沟通的效率。
  1. 图像描述:深度学习能够自动为图像生成描述文本,例如对于一张 “一只可爱的小狗坐在沙滩上画的爱心里面” 的图片,模型可以生成类似 “A cute little dog sitting in a heart drawn on a sandy beach.” 的描述,该技术在图像检索、视觉障碍辅助等领域具有重要意义。
  1. 自然语言文本合成:给定内容(如 “Two dogs play by a tree.”)和风格(如 “happily, love”),深度学习模型(如 RNN)可以生成符合要求的文本(如 “Two dogs in love play happily by a tree.”),为创意写作、广告文案生成等提供了帮助。

除此之外,PPT 中还列出了现代深度学习时代的诸多亮点事件:

  • 2012 年,谷歌大脑团队的神经网络在观看 YouTube 视频后开始识别猫,研究人员也开始对各种任务进行深度学习。
  • 2013 年,word2vec 将上下文引入单词和短语,使理解含义更近一步。
  • 2014 年,语音识别的错误率下降了 25%,GAN 网络被提出,Skype 实现实时语音翻译,聊天机器人 Eugene Goostman 通过了图灵测试,神经网络的序列到序列学习出现。
  • 2015 年,自动生成图像标题技术将图像转换为句子,微软的 ResNet 训练了 1000 层网络,在图像识别准确度上击败了人类,百度的深度语音 2 实现端到端语音识别,Gmail 实现智能回复。
  • 2016 年,YOLO(You Only Look Once)实现了实时目标检测,可视问答允许基于图像的提问,AlphaGo 战胜了专业的围棋手,Google WaveNets 帮助生成逼真的音频。
  • 2017 年,微软在会话语音识别中实现了人类对等水平,AlphaGo Zero 在三天内学会自己玩围棋,胶囊网(Capsule Nets)修复了 CNN 中的缺陷,张量处理单元(TPU)被引入,加州允许销售自动驾驶汽车,Pix2Pix 允许从草图生成图像。

还有一些其他令人惊叹的深度学习应用案例:

  • Navidia 最新的人工智能软件可以将粗糙的涂鸦变成现实的风景,为艺术创作提供了全新的方式。
  • 盲人用户可以使用微软的 Seeing AI 通过触摸探索照片,该应用为视觉障碍人群带来了便利,让他们也能 “感受” 到图像的内容。
  • 脑机接口技术取得了显著进展,让人可以用意念控制机器臂进行连续、快速的运动,只需戴上 “电极帽” 就能指挥外物。例如,美国旧金山的 Smart Cap 公司将脑电图做成了棒球帽,该产品可用于缓解卡车司机的疲劳驾驶,提高注意力。
  • 华智冰作为一款人工智能,也展现出了深度学习在多个领域的综合应用能力。

五、图灵测试:人工智能的重要衡量标准

(一)图灵测试的提出

艾伦・麦席森・图灵是英国数学家、逻辑学家,被誉为 “计算机科学之父”“人工智能之父”。1950 年,他在《Computing Machinery and Intelligence》一文中提出了图灵测试的概念:“一个人在不接触对方的情况下,通过一种特殊的方式,和对方进行一系列的问答。如果在相当长时间内,他无法根据这些问题判断对方是人还是计算机,那么就可以认为这个计算机是智能的”。

(二)图灵测试的过程

在图灵测试中,测试者与被测试者(一个人和一台机器)隔开,测试者通过一些装置(如键盘)向被测试者随意提问。进行多次测试后,如果机器让平均每个参与者做出超过 30% 的误判,即参与者无法准确区分被测试者是人还是机器,那么这台机器就通过了测试,并被认为具有人类智能。

(三)相关影视作品

电影《模仿游戏》改编自安德鲁・霍奇斯编著的传记《艾伦・图灵传》,讲述了 “计算机科学之父” 艾伦・图灵的传奇人生,故事主要聚焦于图灵协助盟军破译德国密码系统 “英格玛”,从而扭转二战战局的经历,让更多人了解到了图灵的伟大贡献。

六、深度学习框架:PyTorch 的优势与应用

在深度学习的实践过程中,深度学习框架起着至关重要的作用,它为开发者提供了丰富的工具和接口,简化了模型的开发、训练和部署过程。PPT 中重点介绍了 PyTorch 框架。

(一)PyTorch 的发展现状

从 2019 年 3 月 1 日到 2023 年 3 月 31 日的框架使用趋势数据来看,PyTorch 的受欢迎程度不断上升。以 2022 年 3 月为例,在论文实现中,PyTorch 占比 67%(3659 个仓库),TensorFlow 占比 8%(436 个仓库),JAX 占比 1%(29 个仓库),MXNet 占比 0%(3 个仓库),PaddlePaddle 占比 0%(23 个仓库),torch 占比 0%(2 个仓库),Caffe2 占比 0%(0 个仓库),MindSpore 占比 1%(55 个仓库),其他语言和框架占比 23%(1292 个仓库)。由此可见,PyTorch 在学术界和工业界得到了广泛的应用。

(二)PyTorch 的特点

PyTorch 是由 Meta AI(Facebook)人工智能研究小组开发的一种基于 Lua 编写的 Torch 库的 Python 实现的深度学习库。它在 API 的设计上更加简洁、优雅和易懂,便于开发者学习和使用,能够快速实现各种深度学习模型,因此成为了许多课程和项目的首选框架。

七、总结与展望

通过对这份深度学习预备知识 PPT 的学习,我们全面了解了深度学习的相关职位需求、人类工业文明的演变、人工智能的概念与生活应用、机器学习的基础理论、深度学习的发展与成功案例、图灵测试以及深度学习框架等内容。深度学习作为一门快速发展的技术,正以惊人的速度改变着世界,为各个领域带来了新的机遇和挑战。

在未来,随着技术的不断进步,深度学习将会在更多领域得到应用,解决更多复杂的问题。对于想要进入深度学习领域的人来说,需要不断学习和掌握新的知识和技能,提高自己的专业素养。同时,我们也应该关注深度学习带来的伦理、隐私等问题,确保技术的健康、可持续发展。

相信在不久的将来,深度学习将会创造出更多的奇迹,为人类社会的进步做出更大的贡献。让我们一起期待并参与到这个智能时代的发展进程中,共同开启深度学习的新篇章!

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐