AI、机器学习与深度学习到底在讲什么
欢迎拜访:雾里看山-CSDN博客
本篇主题:AI、机器学习与深度学习到底在讲什么
发布时间:2026.8.25
隶属专栏:AI进化之路

目录
先从一个问题开始
最近几年,几乎每隔一段时间就会冒出一个新词:今天叫 大模型,明天叫 生成式 AI,后天又叫 AGI。如果你刚准备系统学习 AI,第一反应大概率是——这些词到底是不是一回事,到底应该从哪一层开始看。
这一篇不写公式,也不急着上手 Python。先把三个最容易混淆的概念放在一张图里讲清楚:
AI(Artificial Intelligence,人工智能)ML(Machine Learning,机器学习)DL(Deep Learning,深度学习)
以及它们和最近两年最火的 LLM(Large Language Model,大语言模型)到底是什么关系。
一句话区分三个概念
如果你只想记一句话,可以这样记:
AI是一个目标,ML是达成目标的主流方法,DL是ML里效果最好的一类算法,而大模型是DL在数据和参数规模放大之后的产物。
AI:我们要让机器“像人一样思考”
AI 在讲什么
人工智能 这个概念最早可以追溯到 1956 年的 达特茅斯会议。它的目标其实非常朴素:
让机器表现出通常需要人类智慧才能完成的能力,比如推理、规划、理解语言、识别图像、做决策。
从这个角度看,AI 不是一个具体技术,而是一个研究方向。它里面既包括今天的深度学习,也包括很多传统方法,比如:
- 基于规则的专家系统(例如早期医疗诊断系统
MYCIN) - 搜索算法(例如围棋 AI
AlphaGo中的蒙特卡洛树搜索) - 概率图模型、规划算法、知识图谱
- 以及今天主流的机器学习
所以看到 AI 这个词时,先把它理解成“问题域”,再往下看是用什么方法去解决。
AI 不是一个独立学科
AI 本质上是计算机科学、数学、心理学、语言学等学科的交叉。这种交叉属性也决定了:学 AI 时,只盯着一类算法看是不行的,必须同时理解问题、模型、数据和工程。
机器学习:让机器自己从数据里学规律
为什么需要 ML
传统程序是“人写规则,机器执行”,比如:
if 邮件包含 "免费" and "中奖":
标记为垃圾邮件
但现实中很多问题写不出明确规则,比如图片里有没有猫、句子表达的是不是讽刺。机器学习 的核心思路换了一个角度:
人不写规则,而是给机器一堆“输入 + 正确答案”的样本,让它自己拟合出规律。
这就是 ML(Machine Learning)。它把“写规则”这件事从程序员手里,转移到了算法和数据上。
三类基本范式
ML 主要分三类学习方式,写代码、写博客、面试都会反复出现:
| 范式 | 数据长什么样 | 经典任务 | 典型算法 |
|---|---|---|---|
| 监督学习(Supervised Learning) | 有标签:(输入, 正确答案) |
分类、回归 | 线性回归、决策树、SVM |
| 无监督学习(Unsupervised Learning) | 没有标签,只有输入 | 聚类、降维 | K-Means、PCA |
| 强化学习(Reinforcement Learning) | 通过“行动 + 奖励”反馈学习 | 游戏、机器人、自动驾驶 | Q-Learning、PPO |
题外话:还有“自监督学习(Self-Supervised Learning)”,它是今天
大模型训练的核心范式,本质是把“没有标签的数据”想办法变成“有伪标签的数据”,比如让模型预测下一个词。
ML 的典型工作流
一个标准的 ML 项目大致长这样:
- 收集数据:清洗、采样、划分训练集/验证集/测试集。
- 特征工程:把原始数据变成模型能吃的特征。
- 选模型:根据任务选
LR、XGBoost、Transformer等。 - 训练:用训练集拟合参数,用验证集调超参。
- 评估:用测试集看泛化效果,避免过拟合。
- 部署上线:把模型变成可调用的服务。
深度学习:把“特征工程”自动化掉
DL 在解决什么问题
传统 ML 有个很麻烦的环节——特征工程。比如做图像识别,需要人肉设计“边缘检测算子”、“HOG 特征”;做 NLP,需要设计 TF-IDF、词袋模型。这一步非常依赖专家经验。
深度学习 的核心贡献是:让神经网络自己学特征。
它用多层(“深”)的人工神经元堆叠,自动从原始数据中提取从简单到复杂的特征表示。
举一个直观的例子:
- 浅层神经元可能学到“边缘”、“颜色块”。
- 中间层神经元可能学到“眼睛”、“车轮”。
- 深层神经元可能学到“人脸”、“汽车”。
整个过程不需要人肉告诉模型“什么是边缘”,只要给它足够多的数据和合适的网络结构就行。
神经网络是什么
神经网络(Neural Network)是最基本的 DL 模型单元。它的设计灵感来自生物神经元,本质上是:
一连串可学习的线性变换 + 非线性激活函数的组合。
常见的基本网络结构包括:
MLP(多层感知机):最朴素的“全连接”网络。CNN(卷积神经网络):擅长图像、视频。RNN(循环神经网络):擅长序列数据(早期 NLP、语音)。Transformer:今天几乎所有大模型的基石,后续会单独拆一篇讲。
DL 为什么这几年才爆发
DL 的基础结构在 1980 年代就有了,但真正爆发是 2012 年之后。背后有三个关键条件同时成熟:
- 数据:互联网和移动设备带来了海量标注和未标注数据。
- 算力:
GPU(尤其是CUDA生态)让训练大规模网络变得现实。 - 算法:ReLU、Dropout、BatchNorm、Transformer 等新结构让训练更稳定。
可以理解为:DL 不是突然发明出来的,而是“数据 + 算力 + 算法”三件事同时具备后的必然结果。
大模型:DL 的规模化产物
LLM 是什么
LLM(Large Language Model,大语言模型)指的是参数规模和训练数据规模都达到非常大数量级的语言模型。
一个粗略的参考尺度:
| 阶段 | 参数量级 | 典型代表 |
|---|---|---|
| 早期预训练模型 | 几亿到几亿(<1B) |
BERT-Base、GPT-1 |
| 中型预训练模型 | 几十亿(~10B) |
GPT-2、T5 |
| 现代大模型 | 几百亿到几千亿(100B+) |
GPT-3、LLaMA-3、Qwen-2、DeepSeek-V3 |
注意,“大模型”并不严格等于“大语言模型”。今天也有视觉大模型、多模态大模型、代码大模型等。但因为 LLM 是最出圈、最通用的一类,所以大家平时说的大模型,多数时候指的就是 LLM。
大模型和传统 DL 的差别
虽然 LLM 底层依然是 DL,但它有几个明显不同的特征:
- 规模大:参数量、训练数据量、训练算力都比传统模型高几个数量级。
- 通用性强:同一个模型能做问答、写作、翻译、写代码、做数学题。
- 涌现能力:在规模突破某个阈值后,模型会突然具备一些在小模型上看不到的能力,比如复杂推理。
- 新范式:训练阶段用自监督学习(预测下一个词),微调阶段用
SFT(监督微调)+RLHF(基于人类反馈的强化学习)。
后面几篇会逐一拆开讲,这里先建立印象。
画一张总览图
把这四层概念放在一张图里看,关系会更清楚:
可以理解为四层同心圆:最外层是目标,向内逐层是更具体的方法,最里层是当前最火的应用形态。
易错点与常见误区
误区 1:把 AI 等同于深度学习
很多人一提 AI 就想到神经网络,其实 AI 还包括符号主义、贝叶斯方法、进化计算等。今天 DL 之所以占主导,是因为它效果好,而不是它“唯一正确”。
误区 2:把大模型等同于 AGI
LLM 很强,但本质上依然是“在大量文本上学下一个词的概率分布”。它没有真正的理解、意识和持续学习能力。把它直接当成 AGI(通用人工智能)会高估它的能力边界。
误区 3:以为学 AI 必须先学高数
数学确实要补,但不是上来就啃《PRML》。更现实的路径是:
- 先会用
Python和PyTorch跑通一个最小例子。 - 再补线性代数、概率、微积分中最核心的子集。
- 最后再回头看推导,才不会半路放弃。
误区 4:忽略数据和工程
很多初学者把精力全花在“模型结构”上,但工业界 80% 的精力其实在数据清洗、特征工程、评测体系、部署工程上。这一条在后续 RAG、Agent、微调 几篇里会反复出现。
这一篇到底要记住什么
用一段话把这一篇压成 5 个要点:
AI是研究目标,ML是让机器从数据中学规律的方法,DL是ML中效果最好的一类算法。ML主要分监督、无监督、强化学习三类,今天的大模型多用自监督学习。DL的核心是用多层神经网络自动学特征,而不是依赖人肉特征工程。大模型是DL的规模化产物,参数规模和数据规模都比传统模型高几个数量级。- 学 AI 不要只追热点模型,要同时理解问题、数据、算法、工程四件事。
给后续几篇打个底
这一篇把概念层面的“地图”画完了。从下一篇开始,会沿着这条主线继续往下走:
- 第 02 篇会专门讲大模型的演进脉络,从
GPT到开源大模型,看看每一代模型到底解决了什么问题。 - 第 03 篇会讲大模型能做什么、不能做什么,避免在工程上踩到不切实际的预期。
- 第 04 篇开始进入工程侧,先讲最朴素的概念——
Token。
⚠️ 写在最后:以上内容是我在系统整理 AI 知识体系时的一些总结和概括,重在把概念边界画清楚。如果你觉得哪一层概念还是模糊的,可以从评论区或者私信和我交流,后续我会按这个分层继续往下拆。
更多推荐

所有评论(0)