大模型学习5 --最小二乘法 , 二元交叉熵 , 极大似然值
这三个概念经常一起出现,因为它们本质上是在说同一件事的不同侧面。
一
1. 最小二乘法(Least Squares)
核心: 让预测值和真实值之间的平方误差和最小。
J=∑i=1n(yi−y^i)2J = \sum_{i=1}^{n}(y_i - \hat{y}_i)^2J=i=1∑n(yi−y^i)2
适用: 回归问题,尤其是线性回归。
求解: 可以直接用正规方程 θ=(XTX)−1XTy\theta = (X^T X)^{-1} X^T yθ=(XTX)−1XTy,也可以用梯度下降。
特点: 对异常值敏感,因为误差被平方放大了。
2. 二元交叉熵(Binary Cross-Entropy)
核心: 衡量模型预测的概率分布与真实标签分布的差异。
L=−[ylog(y^)+(1−y)log(1−y^)]L = -[y\log(\hat{y}) + (1-y)\log(1-\hat{y})]L=−[ylog(y^)+(1−y)log(1−y^)]
适用: 二分类问题。
特点: 配合 Sigmoid 使用时梯度性质好,不会像 MSE 那样容易梯度消失。
3. 极大似然估计(Maximum Likelihood Estimation, MLE)
核心: 找一组参数,使得观测到当前数据的概率最大。
假设数据独立同分布,似然函数为:
L(θ)=∏i=1nP(yi∣xi;θ)L(\theta) = \prod_{i=1}^{n} P(y_i | x_i; \theta)L(θ)=i=1∏nP(yi∣xi;θ)
通常取对数变成对数似然:
ℓ(θ)=∑i=1nlogP(yi∣xi;θ)\ell(\theta) = \sum_{i=1}^{n} \log P(y_i | x_i; \theta)ℓ(θ)=i=1∑nlogP(yi∣xi;θ)
然后最大化 ℓ(θ)\ell(\theta)ℓ(θ)。
4. 三者的内在联系
这是最关键的部分:
(1)最小二乘法 = 高斯噪声下的极大似然估计
假设线性回归的误差服从高斯分布:
yi=θTxi+ϵi,ϵi∼N(0,σ2)y_i = \theta^T x_i + \epsilon_i, \quad \epsilon_i \sim \mathcal{N}(0, \sigma^2)yi=θTxi+ϵi,ϵi∼N(0,σ2)
那么似然函数为:
P(yi∣xi;θ)=12πσexp(−(yi−θTxi)22σ2)P(y_i | x_i; \theta) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(y_i - \theta^T x_i)^2}{2\sigma^2}\right)P(yi∣xi;θ)=2πσ1exp(−2σ2(yi−θTxi)2)
取对数后:
ℓ(θ)=−n2log(2πσ2)−12σ2∑i=1n(yi−θTxi)2\ell(\theta) = -\frac{n}{2}\log(2\pi\sigma^2) - \frac{1}{2\sigma^2}\sum_{i=1}^{n}(y_i - \theta^T x_i)^2ℓ(θ)=−2nlog(2πσ2)−2σ21i=1∑n(yi−θTxi)2
最大化对数似然等价于最小化平方误差和。所以,最小二乘法就是误差服从高斯分布时的极大似然估计。
(2)二元交叉熵 = 伯努利分布下的极大似然估计
二分类中,标签 y∈{0,1}y \in \{0, 1\}y∈{0,1},假设:
P(y∣x;θ)=y^y(1−y^)1−yP(y | x; \theta) = \hat{y}^y (1-\hat{y})^{1-y}P(y∣x;θ)=y^y(1−y^)1−y
似然函数为:
L(θ)=∏i=1ny^iyi(1−y^i)1−yiL(\theta) = \prod_{i=1}^{n} \hat{y}_i^{y_i} (1-\hat{y}_i)^{1-y_i}L(θ)=i=1∏ny^iyi(1−y^i)1−yi
取负对数:
−ℓ(θ)=−∑i=1n[yilogy^i+(1−yi)log(1−y^i)]-\ell(\theta) = -\sum_{i=1}^{n}[y_i\log\hat{y}_i + (1-y_i)\log(1-\hat{y}_i)]−ℓ(θ)=−i=1∑n[yilogy^i+(1−yi)log(1−y^i)]
最小化二元交叉熵等价于最大化伯努利分布下的对数似然。所以,二元交叉熵就是二分类问题在伯努利假设下的极大似然估计。
5. 一张表总结
| 概念 | 本质 | 对应分布假设 | 适用任务 |
|---|---|---|---|
| 最小二乘法 | 最小化平方误差 | 高斯分布 | 回归 |
| 二元交叉熵 | 最小化概率分布差异 | 伯努利分布 | 二分类 |
| 极大似然估计 | 最大化观测数据的概率 | 任意分布 | 通用框架 |
6. 一句话总结
极大似然估计是统一的框架;最小二乘法和二元交叉熵分别是它在高斯分布和伯努利分布下的具体形式。
- 回归用最小二乘,等价于假设误差服从高斯分布做 MLE。
- 二分类用交叉熵,等价于假设标签服从伯努利分布做 MLE。
三者不是并列关系,而是同一个思想在不同任务、不同分布假设下的体现。
二
下面把这三个概念从定义、公式推导、内在联系三个层面展开讲清楚。
一、极大似然估计(MLE)——统一框架
1.1 核心思想
极大似然估计是一种参数估计方法。它的逻辑是:
已经观测到了一组数据,那么什么样的参数最有可能产生这组数据?——让这组数据出现概率最大的那个参数。
1.2 数学形式
假设有独立同分布的样本 (x1,y1),(x2,y2),…,(xn,yn)(x_1, y_1), (x_2, y_2), \dots, (x_n, y_n)(x1,y1),(x2,y2),…,(xn,yn),模型参数为 θ\thetaθ。
似然函数定义为:
L(θ)=∏i=1nP(yi∣xi;θ)L(\theta) = \prod_{i=1}^{n} P(y_i | x_i; \theta)L(θ)=i=1∏nP(yi∣xi;θ)
由于连乘容易下溢,通常取对数:
ℓ(θ)=logL(θ)=∑i=1nlogP(yi∣xi;θ)\ell(\theta) = \log L(\theta) = \sum_{i=1}^{n} \log P(y_i | x_i; \theta)ℓ(θ)=logL(θ)=i=1∑nlogP(yi∣xi;θ)
极大似然估计就是:
θ^MLE=argmaxθℓ(θ)\hat{\theta}_{MLE} = \arg\max_{\theta} \ell(\theta)θ^MLE=argθmaxℓ(θ)
等价于:
θ^MLE=argminθ[−ℓ(θ)]\hat{\theta}_{MLE} = \arg\min_{\theta} \left[ -\ell(\theta) \right]θ^MLE=argθmin[−ℓ(θ)]
负对数似然(Negative Log-Likelihood, NLL) 就是常用的损失函数。
1.3 关键点
- MLE 是一个通用框架,具体形式取决于你假设数据服从什么分布。
- 不同的分布假设,会导出不同的损失函数。
- 这正是最小二乘法和交叉熵的来源。
二、最小二乘法——高斯分布下的 MLE
2.1 问题设定
线性回归模型:
yi=θTxi+ϵiy_i = \theta^T x_i + \epsilon_iyi=θTxi+ϵi
假设误差项独立同分布,且服从均值为 0、方差为 σ2\sigma^2σ2 的高斯分布:
ϵi∼N(0,σ2)\epsilon_i \sim \mathcal{N}(0, \sigma^2)ϵi∼N(0,σ2)
2.2 推导似然函数
因为 ϵi=yi−θTxi\epsilon_i = y_i - \theta^T x_iϵi=yi−θTxi,所以:
yi∣xi;θ∼N(θTxi,σ2)y_i | x_i; \theta \sim \mathcal{N}(\theta^T x_i, \sigma^2)yi∣xi;θ∼N(θTxi,σ2)
其概率密度为:
P(yi∣xi;θ)=12πσexp(−(yi−θTxi)22σ2)P(y_i | x_i; \theta) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left( -\frac{(y_i - \theta^T x_i)^2}{2\sigma^2} \right)P(yi∣xi;θ)=2πσ1exp(−2σ2(yi−θTxi)2)
似然函数:
L(θ)=∏i=1n12πσexp(−(yi−θTxi)22σ2)L(\theta) = \prod_{i=1}^{n} \frac{1}{\sqrt{2\pi}\sigma} \exp\left( -\frac{(y_i - \theta^T x_i)^2}{2\sigma^2} \right)L(θ)=i=1∏n2πσ1exp(−2σ2(yi−θTxi)2)
取对数:
ℓ(θ)=−n2log(2πσ2)−12σ2∑i=1n(yi−θTxi)2\ell(\theta) = -\frac{n}{2}\log(2\pi\sigma^2) - \frac{1}{2\sigma^2}\sum_{i=1}^{n}(y_i - \theta^T x_i)^2ℓ(θ)=−2nlog(2πσ2)−2σ21i=1∑n(yi−θTxi)2
2.3 等价于最小二乘
上式中,第一项 −n2log(2πσ2)-\frac{n}{2}\log(2\pi\sigma^2)−2nlog(2πσ2) 与 θ\thetaθ 无关,是常数。
所以要最大化 ℓ(θ)\ell(\theta)ℓ(θ),等价于最小化:
∑i=1n(yi−θTxi)2\sum_{i=1}^{n}(y_i - \theta^T x_i)^2i=1∑n(yi−θTxi)2
这正是残差平方和,也就是最小二乘法的目标函数。
2.4 结论
最小二乘法 = 误差服从高斯分布时的极大似然估计。
这也解释了为什么最小二乘法对异常值敏感:高斯分布的尾部很薄,异常值在似然中会被平方放大,模型被迫去拟合它们。
三、二元交叉熵——伯努利分布下的 MLE
3.1 问题设定
二分类问题,标签 y∈{0,1}y \in \{0, 1\}y∈{0,1}。
模型输出 y^=σ(θTx)\hat{y} = \sigma(\theta^T x)y^=σ(θTx),其中 σ\sigmaσ 是 Sigmoid 函数:
σ(z)=11+e−z\sigma(z) = \frac{1}{1 + e^{-z}}σ(z)=1+e−z1
y^\hat{y}y^ 表示预测为正类(y=1y=1y=1)的概率。
3.2 伯努利分布假设
假设给定 xxx,标签 yyy 服从伯努利分布:
P(y∣x;θ)=y^y(1−y^)1−yP(y | x; \theta) = \hat{y}^y (1 - \hat{y})^{1-y}P(y∣x;θ)=y^y(1−y^)1−y
- 当 y=1y = 1y=1 时,P=y^P = \hat{y}P=y^
- 当 y=0y = 0y=0 时,P=1−y^P = 1 - \hat{y}P=1−y^
这个式子巧妙地把两种情况统一写成了一个表达式。
3.3 推导似然函数
似然函数:
L(θ)=∏i=1ny^iyi(1−y^i)1−yiL(\theta) = \prod_{i=1}^{n} \hat{y}_i^{y_i} (1 - \hat{y}_i)^{1-y_i}L(θ)=i=1∏ny^iyi(1−y^i)1−yi
取对数:
ℓ(θ)=∑i=1n[yilogy^i+(1−yi)log(1−y^i)]\ell(\theta) = \sum_{i=1}^{n} \left[ y_i \log \hat{y}_i + (1-y_i)\log(1-\hat{y}_i) \right]ℓ(θ)=i=1∑n[yilogy^i+(1−yi)log(1−y^i)]
3.4 等价于二元交叉熵
最大化对数似然,等价于最小化负对数似然:
−ℓ(θ)=−∑i=1n[yilogy^i+(1−yi)log(1−y^i)]-\ell(\theta) = -\sum_{i=1}^{n} \left[ y_i \log \hat{y}_i + (1-y_i)\log(1-\hat{y}_i) \right]−ℓ(θ)=−i=1∑n[yilogy^i+(1−yi)log(1−y^i)]
这正是二元交叉熵损失。
3.5 结论
二元交叉熵 = 标签服从伯努利分布时的极大似然估计。
这也解释了为什么交叉熵配合 Sigmoid 梯度性质好:Sigmoid 是伯努利分布的“自然”链接函数(广义线性模型中的 canonical link),两者匹配时梯度形式最简洁。
四、多分类交叉熵——类别分布下的 MLE
同样的逻辑可以推广到多分类。
4.1 问题设定
标签 y∈{1,2,…,C}y \in \{1, 2, \dots, C\}y∈{1,2,…,C},用 one-hot 编码表示为 yi=(yi1,…,yiC)y_i = (y_{i1}, \dots, y_{iC})yi=(yi1,…,yiC)。
模型输出经 Softmax 得到概率分布:
y^ic=exp(zic)∑j=1Cexp(zij)\hat{y}_{ic} = \frac{\exp(z_{ic})}{\sum_{j=1}^{C}\exp(z_{ij})}y^ic=∑j=1Cexp(zij)exp(zic)
4.2 类别分布假设
P(yi∣xi;θ)=∏c=1Cy^icyicP(y_i | x_i; \theta) = \prod_{c=1}^{C} \hat{y}_{ic}^{y_{ic}}P(yi∣xi;θ)=c=1∏Cy^icyic
4.3 对数似然与交叉熵
ℓ(θ)=∑i=1n∑c=1Cyiclogy^ic\ell(\theta) = \sum_{i=1}^{n} \sum_{c=1}^{C} y_{ic} \log \hat{y}_{ic}ℓ(θ)=i=1∑nc=1∑Cyiclogy^ic
负对数似然:
−ℓ(θ)=−∑i=1n∑c=1Cyiclogy^ic-\ell(\theta) = -\sum_{i=1}^{n} \sum_{c=1}^{C} y_{ic} \log \hat{y}_{ic}−ℓ(θ)=−i=1∑nc=1∑Cyiclogy^ic
这就是多分类交叉熵损失。
多分类交叉熵 = 标签服从类别分布(Categorical Distribution)时的极大似然估计。
五、三者的统一关系图
极大似然估计(MLE)
│
┌─────────────────┼─────────────────┐
│ │ │
高斯分布假设 伯努利分布假设 类别分布假设
│ │ │
▼ ▼ ▼
最小二乘法 二元交叉熵 多分类交叉熵
(回归) (二分类) (多分类)
核心逻辑:
- MLE 是统一框架:给定分布假设,最大化观测数据的概率。
- 分布假设决定损失函数:
- 高斯 → 平方误差 → 最小二乘
- 伯努利 → 二元交叉熵
- 类别分布 → 多分类交叉熵
- 最小化损失 = 最大化似然:负对数似然就是损失函数。
六、为什么理解这个联系很重要
6.1 解释损失函数的选择
- 回归用 MSE,不是随便选的,是因为假设误差服从高斯分布。
- 分类用交叉熵,也不是随便选的,是因为假设标签服从伯努利/类别分布。
- 如果数据的真实分布与假设不符,损失函数就不是最优的。比如回归中误差重尾(异常值多),高斯假设不成立,就可以改用拉普拉斯分布,导出 MAE(平均绝对误差)。
6.2 理解正则化
加入 L2 正则化的最小二乘,等价于高斯先验下的最大后验估计(MAP):
θ^MAP=argmaxθ[ℓ(θ)+logP(θ)]\hat{\theta}_{MAP} = \arg\max_{\theta} \left[ \ell(\theta) + \log P(\theta) \right]θ^MAP=argθmax[ℓ(θ)+logP(θ)]
- L2 正则 ↔ 高斯先验
- L1 正则 ↔ 拉普拉斯先验
6.3 指导模型设计
- 知道 Sigmoid + 交叉熵是匹配的,就不会乱用 Sigmoid + MSE。
- 知道 Softmax + 交叉熵是匹配的,就理解为什么多分类标准做法是这样。
七、一句话总结
极大似然估计是统一的参数估计框架;最小二乘法和交叉熵分别是它在高斯分布和伯努利/类别分布假设下的具体实现。选择什么损失函数,本质上是在选择你对数据分布的假设。
更多推荐



所有评论(0)