欢迎拜访雾里看山-CSDN博客
本篇主题:AI、机器学习与深度学习到底在讲什么
发布时间:2026.8.25
隶属专栏AI进化之路

在这里插入图片描述

先从一个问题开始

最近几年,几乎每隔一段时间就会冒出一个新词:今天叫 大模型,明天叫 生成式 AI,后天又叫 AGI。如果你刚准备系统学习 AI,第一反应大概率是——这些词到底是不是一回事,到底应该从哪一层开始看。

这一篇不写公式,也不急着上手 Python。先把三个最容易混淆的概念放在一张图里讲清楚:

  • AI(Artificial Intelligence,人工智能)
  • ML(Machine Learning,机器学习)
  • DL(Deep Learning,深度学习)

以及它们和最近两年最火的 LLM(Large Language Model,大语言模型)到底是什么关系。

一句话区分三个概念

如果你只想记一句话,可以这样记:

AI 是一个目标,ML 是达成目标的主流方法,DLML 里效果最好的一类算法,而 大模型DL 在数据和参数规模放大之后的产物。

AI:我们要让机器“像人一样思考”

AI 在讲什么

人工智能 这个概念最早可以追溯到 1956 年的 达特茅斯会议。它的目标其实非常朴素:

让机器表现出通常需要人类智慧才能完成的能力,比如推理、规划、理解语言、识别图像、做决策。

从这个角度看,AI 不是一个具体技术,而是一个研究方向。它里面既包括今天的深度学习,也包括很多传统方法,比如:

  • 基于规则的专家系统(例如早期医疗诊断系统 MYCIN
  • 搜索算法(例如围棋 AI AlphaGo 中的蒙特卡洛树搜索)
  • 概率图模型、规划算法、知识图谱
  • 以及今天主流的机器学习

所以看到 AI 这个词时,先把它理解成“问题域”,再往下看是用什么方法去解决。

AI 不是一个独立学科

AI 本质上是计算机科学、数学、心理学、语言学等学科的交叉。这种交叉属性也决定了:学 AI 时,只盯着一类算法看是不行的,必须同时理解问题、模型、数据和工程。

机器学习:让机器自己从数据里学规律

为什么需要 ML

传统程序是“人写规则,机器执行”,比如:

if 邮件包含 "免费" and "中奖":
    标记为垃圾邮件

但现实中很多问题写不出明确规则,比如图片里有没有猫、句子表达的是不是讽刺。机器学习 的核心思路换了一个角度:

人不写规则,而是给机器一堆“输入 + 正确答案”的样本,让它自己拟合出规律。

这就是 ML(Machine Learning)。它把“写规则”这件事从程序员手里,转移到了算法和数据上。

三类基本范式

ML 主要分三类学习方式,写代码、写博客、面试都会反复出现:

范式 数据长什么样 经典任务 典型算法
监督学习(Supervised Learning) 有标签:(输入, 正确答案) 分类、回归 线性回归、决策树、SVM
无监督学习(Unsupervised Learning) 没有标签,只有输入 聚类、降维 K-MeansPCA
强化学习(Reinforcement Learning) 通过“行动 + 奖励”反馈学习 游戏、机器人、自动驾驶 Q-LearningPPO

题外话:还有“自监督学习(Self-Supervised Learning)”,它是今天 大模型 训练的核心范式,本质是把“没有标签的数据”想办法变成“有伪标签的数据”,比如让模型预测下一个词。

ML 的典型工作流

一个标准的 ML 项目大致长这样:

  1. 收集数据:清洗、采样、划分训练集/验证集/测试集。
  2. 特征工程:把原始数据变成模型能吃的特征。
  3. 选模型:根据任务选 LRXGBoostTransformer 等。
  4. 训练:用训练集拟合参数,用验证集调超参。
  5. 评估:用测试集看泛化效果,避免过拟合。
  6. 部署上线:把模型变成可调用的服务。

深度学习:把“特征工程”自动化掉

DL 在解决什么问题

传统 ML 有个很麻烦的环节——特征工程。比如做图像识别,需要人肉设计“边缘检测算子”、“HOG 特征”;做 NLP,需要设计 TF-IDF词袋模型。这一步非常依赖专家经验。

深度学习 的核心贡献是:让神经网络自己学特征

它用多层(“深”)的人工神经元堆叠,自动从原始数据中提取从简单到复杂的特征表示。

举一个直观的例子:

  • 浅层神经元可能学到“边缘”、“颜色块”。
  • 中间层神经元可能学到“眼睛”、“车轮”。
  • 深层神经元可能学到“人脸”、“汽车”。

整个过程不需要人肉告诉模型“什么是边缘”,只要给它足够多的数据和合适的网络结构就行。

神经网络是什么

神经网络(Neural Network)是最基本的 DL 模型单元。它的设计灵感来自生物神经元,本质上是:

一连串可学习的线性变换 + 非线性激活函数的组合。

常见的基本网络结构包括:

  • MLP(多层感知机):最朴素的“全连接”网络。
  • CNN(卷积神经网络):擅长图像、视频。
  • RNN(循环神经网络):擅长序列数据(早期 NLP、语音)。
  • Transformer:今天几乎所有大模型的基石,后续会单独拆一篇讲。

DL 为什么这几年才爆发

DL 的基础结构在 1980 年代就有了,但真正爆发是 2012 年之后。背后有三个关键条件同时成熟:

  1. 数据:互联网和移动设备带来了海量标注和未标注数据。
  2. 算力GPU(尤其是 CUDA 生态)让训练大规模网络变得现实。
  3. 算法:ReLU、Dropout、BatchNorm、Transformer 等新结构让训练更稳定。

可以理解为:DL 不是突然发明出来的,而是“数据 + 算力 + 算法”三件事同时具备后的必然结果。

大模型:DL 的规模化产物

LLM 是什么

LLM(Large Language Model,大语言模型)指的是参数规模和训练数据规模都达到非常大数量级的语言模型

一个粗略的参考尺度:

阶段 参数量级 典型代表
早期预训练模型 几亿到几亿(<1B BERT-BaseGPT-1
中型预训练模型 几十亿(~10B GPT-2T5
现代大模型 几百亿到几千亿(100B+ GPT-3LLaMA-3Qwen-2DeepSeek-V3

注意,“大模型”并不严格等于“大语言模型”。今天也有视觉大模型、多模态大模型、代码大模型等。但因为 LLM 是最出圈、最通用的一类,所以大家平时说的大模型,多数时候指的就是 LLM

大模型和传统 DL 的差别

虽然 LLM 底层依然是 DL,但它有几个明显不同的特征:

  1. 规模大:参数量、训练数据量、训练算力都比传统模型高几个数量级。
  2. 通用性强:同一个模型能做问答、写作、翻译、写代码、做数学题。
  3. 涌现能力:在规模突破某个阈值后,模型会突然具备一些在小模型上看不到的能力,比如复杂推理。
  4. 新范式:训练阶段用自监督学习(预测下一个词),微调阶段用 SFT(监督微调)+ RLHF(基于人类反馈的强化学习)。

后面几篇会逐一拆开讲,这里先建立印象。

画一张总览图

把这四层概念放在一张图里看,关系会更清楚:
在这里插入图片描述

可以理解为四层同心圆:最外层是目标,向内逐层是更具体的方法,最里层是当前最火的应用形态。

易错点与常见误区

误区 1:把 AI 等同于深度学习

很多人一提 AI 就想到神经网络,其实 AI 还包括符号主义、贝叶斯方法、进化计算等。今天 DL 之所以占主导,是因为它效果好,而不是它“唯一正确”。

误区 2:把大模型等同于 AGI

LLM 很强,但本质上依然是“在大量文本上学下一个词的概率分布”。它没有真正的理解、意识和持续学习能力。把它直接当成 AGI(通用人工智能)会高估它的能力边界。

误区 3:以为学 AI 必须先学高数

数学确实要补,但不是上来就啃《PRML》。更现实的路径是:

  1. 先会用 PythonPyTorch 跑通一个最小例子。
  2. 再补线性代数、概率、微积分中最核心的子集。
  3. 最后再回头看推导,才不会半路放弃。

误区 4:忽略数据和工程

很多初学者把精力全花在“模型结构”上,但工业界 80% 的精力其实在数据清洗、特征工程、评测体系、部署工程上。这一条在后续 RAGAgent微调 几篇里会反复出现。

这一篇到底要记住什么

用一段话把这一篇压成 5 个要点:

  • AI 是研究目标,ML 是让机器从数据中学规律的方法,DLML 中效果最好的一类算法。
  • ML 主要分监督、无监督、强化学习三类,今天的大模型多用自监督学习。
  • DL 的核心是用多层神经网络自动学特征,而不是依赖人肉特征工程。
  • 大模型DL 的规模化产物,参数规模和数据规模都比传统模型高几个数量级。
  • 学 AI 不要只追热点模型,要同时理解问题、数据、算法、工程四件事。

给后续几篇打个底

这一篇把概念层面的“地图”画完了。从下一篇开始,会沿着这条主线继续往下走:

  • 第 02 篇会专门讲大模型的演进脉络,从 GPT 到开源大模型,看看每一代模型到底解决了什么问题。
  • 第 03 篇会讲大模型能做什么、不能做什么,避免在工程上踩到不切实际的预期。
  • 第 04 篇开始进入工程侧,先讲最朴素的概念——Token

⚠️ 写在最后:以上内容是我在系统整理 AI 知识体系时的一些总结和概括,重在把概念边界画清楚。如果你觉得哪一层概念还是模糊的,可以从评论区或者私信和我交流,后续我会按这个分层继续往下拆。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐