生成模型中用到的统计学概念
生成模型的分类
• GAN模型:GAN模型由两个神经网络组成,即生成器(generator)和判别器(discriminator)。这两个神经网络同时进行训练。生成器负责生成新样本,判别器试图区分数据是真实样本还是生成的假样本。经过一段时间的训练,生成器的表现会越来越好。最终,判别器无法区分真假样本。也就是说,GAN模型可以生成以假乱真的数据。GAN模型在图像生成任务中深受欢迎,如用于生成真实的人脸图片或艺术品图片。
• 自回归模型(autoregressive model):基于过去的数据点来预测新数据点的模型。回归任务的输出是连续值。只不过,自回归模型不是根据输入数据 x 预测输出数据 y ,而是预测与输入数据具有相同分布的新样本,相当于根据 x 预测其自身(新的 x ),这也是称之为自回归模型的原因。大语言模型GPT就是自回归模型。
• 扩散模型(diffusion model):用于描述事物如何随着时间的推移而传播和发展的模型。很多图像生成大模型和视频生成大模型都是基于扩散模型构建的。
• VAEs模型:一种先生成输入数据的压缩表示,然后将其解码以生成新数据的模型。其通常用于图像去噪任务,或者用于生成具有输入数据特征的新图像。与扩散模型一样,VAEs模型也是构建图像生成大模型和视频生成大模型的经典基础模型。
似然函数、最大似然函数与生成模型的关系
似然函数
“似然”是对“likelihood”的一种较为贴近文言文的翻译,即“可能性”。似然函数是一个关于待估计参数的函数,用于描述已有数据的概率分布。我们可以使用似然函数来衡量在给定参数下观察到特定数据的可能性大小。似然函数通常表示为 L(\theta|x) ,其中 \theta 表示参数, x 表示数据。
我们可以使用概率密度函数来定义似然函数。假定样本空间 X=(x_1,x_2,\dots,x_n) 的概率密度函数为 f(x|\theta) ,其中 \theta 是一个参数, X=x 是一个取样点,则关于参数 \theta 的似然函数表达式如下:
L(\theta|x)=f(x|\theta)
表面看起来,这样做可以把概率密度函数重新标记为似然函数。但实际上,它们有很大的区别。概率密度函数将参数 \theta 视为一个常数,只关注数据 x 的变化情况。而在似然函数中,数据 x 被视为常数, \theta 则可以在参数取值的全域范围内变化。
如果比较概率密度函数中的两个点,则可以知道 x 的两个不同值出现的概率。但似然函数却是通过对参数的比较来评估出现数据的概率的。例如,如果 L(\theta_1|x) > L(\theta_2|x) ,则可以得到这样的结论:参数 \theta=\theta_1 时比 \theta=\theta_2 时更容易观察到取样点 x 。
最大似然估计
最大似然估计是一种基于参数估计的概率密度估计方法,它通过最大化似然函数来找到最能解释观测数据的概率分布和参数。这种灵活的概率估计方法为许多机器学习算法提供了基础。
在最大似然估计中,需要找到一组参数,这些参数可以使数据样本出现的概率最大化。似然函数用于评估在给定模型参数值下,观测数据出现的可能性;最大似然估计则是通过最大化这个似然函数来找到最可能的参数值。
我们首先需要定义一个参数 \theta ,该参数决定了概率密度函数的选择和相应分布的参数。参数 \theta 可以是一个数值向量,其值平滑地变化,并且映射到不同的概率分布及其参数。最大似然估计希望在给定的概率分布及参数中,最大化观测数据的概率。其表示如下:
P(X|\theta)
这个公式表示当参数 \theta 发生的情况下,随机变量 X 也发生的概率。这种给定参数情况下的条件概率通常使用分号(;)表示法来表示,而不是用条形(|)表示法来表示。其表示如下:
P(X;\theta)
或者
P=(x_1,x_2,x_3,\dots,x_n;\theta)
最大似然估计得到的条件概率可以理解为在给定模型参数的情况下,观测数据出现的可能性。因此,其也可以使用似然函数表示,具体表示如下:
L(X;\theta)
假设每个观测值都是独立分布的,则上面的似然函数可以按以下方法计算:
L(X;\theta)=f(x_1;\theta) \times f(x_2;\theta) \times \dots \times f(x_n;\theta)
f(x_i;\theta) 表示当参数 \theta 发生的情况下,变量 x_i 也发生的概率( i=1,2,\dots,n )。也就是说,样本空间 X 发生的概率等于其中每个样本发生的概率相乘。
最大似然估计的目标是找到使似然函数最大化的参数集( \theta )。
在实践中,将许多小概率数据相乘在数值上可能是不稳定的,因此对离散型变量而言,在给定模型参数的情况下,通常将最大似然估计转换为计算每个样本的对数条件概率之和。于是,上面的公式可以转换为以下形式:
L(X;\theta)=\log[f(x_1;\theta)] + \log[f(x_2;\theta)] + \dots + \log[f(x_n;\theta)]
上面的公式也可以表示如下:
L_1(X;\theta)=\sum_i \log P(x_1,x_2,\dots,x_n;\theta)
这个公式在设计和训练GPT模型的过程中发挥着重要作用
更多推荐



所有评论(0)