Transformer的Encoder深度解析:它与自回归有何不同?一篇读懂所有变体

揭秘大模型的心脏:从理解到生成,你的AI是如何思考的?

前言

当我们与ChatGPT对话、使用Google翻译或者让AI总结文档时,背后都有一个共同的“魔法师”——Transformer架构。而在这个架构中,Encoder(编码器) 扮演着至关重要的角色。

今天,我们就来深入浅出地聊聊Transformer的Encoder到底是干什么的,它和当前火热的“自回归”概念有什么关系,以及为什么BERT、GPT虽然都是Transformer家族成员,工作方式却天差地别。

一、Transformer Encoder:不只是“读一遍”那么简单

1.1 Encoder的核心任务

简单来说,Encoder的作用是 “理解输入” ,并把这种理解转换成机器能够处理的数学形式——也就是特征表示或向量。

想象一下你在教AI翻译“我爱技术”这句话:

  • Encoder就像一位认真阅读的读者,它分析每个词的含义:“我”是主语,“爱”是动作,“技术”是对象
  • 它输出的不是翻译结果,而是对这句话的深度理解——一个包含上下文信息的“语义向量”

1.2 Encoder是怎么工作的?

让我们打开Encoder的“黑盒子”,看看它内部的结构:

Encoder Block

多头自注意力

残差连接 & 层归一化

前馈神经网络

残差连接 & 层归一化

输入序列: x1, x2, x3, x4

词嵌入 + 位置编码

Encoder Block 2

...共N个Block...

输出序列: h1, h2, h3, h4

Encoder由多个相同的Block堆叠而成,每个Block包含两个核心子层:

  1. 多头自注意力机制(Multi-Head Self-Attention):让每个词都能“关注”到句子中的所有其他词,理解上下文关系
  2. 前馈神经网络(Feed-Forward Network):对注意力机制输出的信息进行深度加工

此外,每个子层都采用了残差连接层归一化,这有助于防止梯度消失,让训练更加稳定。

1.3 自注意力机制:Encoder的“超能力”

自注意力是Encoder最神奇的地方。它能让模型在处理某个词时,同时考虑句子中所有其他词,从而消除歧义。

比如处理这两句话:

  • “他正在边行走”
  • “他正在行存钱”

通过自注意力机制,“行”字会关注到“河”或“银”,从而知道这两个“行”字的意思完全不同——一个是动作,一个是机构。这就是消除歧义的作用。

1.4 位置编码:顺序也很重要

因为Transformer不像人一样按顺序读词,而是同时看所有词,所以需要额外告诉它词的顺序。

自注意力机制本身不具备顺序感知能力,而自然语言的语义又高度依赖词的顺序。比如“我打你”和“你打我”,词相同但顺序决定语义。

Transformer使用正弦和余弦函数的组合来给每个位置生成唯一的向量,公式如下:

PE(pos,2i)=sin⁡(pos100002i/dmodel)PE_{(pos,2i)} = \sin\left(\frac{pos}{10000^{2i/d_{\text{model}}}}\right)PE(pos,2i)=sin(100002i/dmodelpos)
PE(pos,2i+1)=cos⁡(pos100002i/dmodel)PE_{(pos,2i+1)} = \cos\left(\frac{pos}{10000^{2i/d_{\text{model}}}}\right)PE(pos,2i+1)=cos(100002i/dmodelpos)

二、自回归(Autoregressive):逐字生成的“写作大师”

2.1 什么是自回归?

自回归是一种逐字生成的机制——根据已经生成的内容,预测下一个最可能出现的词。

用数学公式表示就是:
P(w1,w2,...,wn)=P(w1)P(w2∣w1)...P(wn∣w1,...wn−1)P(w_1,w_2,...,w_n) = P(w_1)P(w_2|w_1)...P(w_n|w_1,...w_{n-1})P(w1,w2,...,wn)=P(w1)P(w2w1)...P(wnw1,...wn1)

这就像我们写文章:先写第一个字,然后根据第一个字想第二个字,根据前两个字想第三个字……一步步完成整篇文章。

2.2 自回归的优缺点

优点

  • 具备生成能力:天然适合文本生成任务
  • 上下文紧密相关:每个新词都与前面的内容逻辑连贯
  • 无监督学习:只需要大量的文本数据即可训练

缺点

  • 单向信息:只能看到上文,无法利用下文信息
  • 长期依赖挑战:离得远的内容可能关联性变弱

2.3 Decoder中的自回归实现

在Transformer的Decoder中,自回归通过 Masked Self-Attention(掩码自注意力) 来实现:

训练阶段

BOS

Decoder

EOS

这种掩码机制确保模型在预测第i个位置时,只能看到i之前的内容,不能偷看未来的词。

三、三大模型变体:Encoder和自回归的排列组合

根据如何使用Encoder和Decoder,Transformer衍生出三种主要的模型架构:

Transformer家族

原始Transformer
Encoder-Decoder

Encoder-only
自编码模型

Decoder-only
自回归模型

Encoder-Decoder
完整模型

代表: BERT, RoBERTa
任务: 文本分类、实体识别
特点: 双向上下文理解

代表: GPT系列, LLaMA
任务: 文本生成、对话
特点: 单向自回归生成

代表: T5, BART
任务: 翻译、摘要
特点: 理解+生成

3.1 Encoder-only模型(以BERT为代表)

核心思想:自编码(Autoencoder)语言模型

BERT的训练任务像是**“完形填空”**——随机掩盖输入中的部分单词,让模型根据上下文预测被掩盖的词。

优点

  • 真正意义上的双向上下文理解
  • 对语义理解任务表现出色

缺点

  • 缺乏生成能力
  • 预训练(有[MASK])和微调(无[MASK])存在不一致

典型应用:文本分类、情感分析、命名实体识别

3.2 Decoder-only模型(以GPT为代表)

核心思想:自回归(Autoregressive)语言模型

GPT的训练任务是预测下一个词——给定上文,预测最可能出现的下一个词。

优点

  • 强大的文本生成能力
  • 涌现出上下文学习等能力

缺点

  • 只能利用单向上下文信息

典型应用:对话系统、故事生成、代码编写

3.3 Encoder-Decoder模型(以T5为代表)

核心思想:结合理解和生成

Encoder负责理解输入,Decoder负责生成输出,两者通过交叉注意力(Cross-Attention) 连接。

优点

  • 充分利用上下文信息
  • 适合需要“理解后再生成”的任务

典型应用:机器翻译、文本摘要、问答系统

四、深度对比:谁能“涌现”?

最近的研究发现,模型架构与其能力涌现存在一定关系:

“自回归模型在学习写作的机理,机理学习多了,容易涌现;而自编码模型将注意力放到了写作的机巧,机巧学习多了,反而可能造成混乱。”

这或许解释了为什么GPT系列的Decoder-only模型能够展现出惊人的涌现能力,而BERT等Encoder-only模型虽然理解能力强,但难以产生“智能爆发”的效果。

各类架构对比一览

架构类型 代表模型 注意力机制 擅长任务 生成能力 理解能力
Encoder-only BERT, RoBERTa 双向 分类、实体识别 ⭐⭐⭐⭐⭐
Decoder-only GPT, LLaMA 单向(掩码) 对话、写作 ⭐⭐⭐⭐⭐ ⭐⭐⭐
Encoder-Decoder T5, BART 双向+交叉 翻译、摘要 ⭐⭐⭐⭐ ⭐⭐⭐⭐

五、总结

Encoder的本质:一个强大的特征提取器,负责把原始输入转换成富含语义的向量。

自回归的本质:一种逐字生成的机制,确保生成的内容连贯合理。

在不同的模型架构中,它们的角色各不相同:

  • BERT类模型中,Encoder是主角,负责精读和理解
  • GPT类模型中,虽然没有独立的Encoder,但Decoder通过自回归方式隐式完成了理解任务
  • T5/BART类模型中,Encoder作为“情报分析员”,为Decoder提供充分的上下文信息

理解这些差异,有助于我们根据实际任务选择合适的模型,也能更深入地理解当前大模型技术的发展脉络。


希望这篇文章能帮助你理清Transformer Encoder和自回归的概念。如果你对大模型的其它方面感兴趣,欢迎在评论区留言讨论!

本文首发于CSDN,作者:~墨-。未经许可,禁止转载。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐