01.Transformer中输入的embeding和position embeding是怎么结合的?

img

在 Transformer 模型中,token embedding(词嵌入) 和 positional embedding(位置嵌入) 是通过 逐元素相加(element-wise addition) 的方式结合在一起的。这两个向量的维度相同,通常是dmodel(如 512 或 768)。

为什么采用相加方式?

  1. 同维度可加,结构简洁

相加方法不会改变向量维度,使后续的多头注意力机制流程无需调整。整个模型结构简洁高效。

  1. 有效融合“语义”与“位置”
  • 词嵌入包含了 token 的语义信息;
  • 位置嵌入编码了 token 在序列中的位置信息;
  • 相加后,每个 token 的表示同时携带了“是什么”和“在哪”的信息。
  1. 训练过程中模型学会区分语义与位置

即使两者经过相加,Transformer 模型能够通过注意力机制中的线性变换(如 Query/Key/Value 投影)解开这两个信息维度。实践中,相加方式表现良好且易于训练。

Positional Embedding 的形式

  • 一种是固定的正弦-余弦函数形式(sinusoidal)

公式如下:

img

它的优点包括无需训练参数,以及能对模型进行 跨长度泛化(extrapolate)。

  • 另一种是可学习的位置 embedding

这类 embedding 是为每个位置初始化一个可训练向量,能够更灵活地适应具体任务,但是不具备跨序列长度的泛化能力。

总结流程

  1. 获取token embedding: Xi∈Rdmodel

  2. 获取positional embedding:Pi∈Rdmodel

  3. 组合它们:

Zi=Xi+Pi

  1. 将组合后的Zi输入到Transformer的后续层中(如Multi-Head Attention)。

02.注意力机制有哪几种?

注意力机制(Attention Mechanism)是一种模仿人类视觉聚焦的机制,广泛应用于自然语言处理(NLP)、计算机视觉(CV)等领域。根据其功能和应用场景,注意力机制可分为多种类型。以下是常见的几种注意力机制的详细说明:

  1. 自注意力(Self-Attention)
  • 定义:在自注意力机制中,查询(Query)、键(Key)和值(Value)都来自同一输入序列或特征图。

  • 作用:捕捉序列内部或特征图内部的全局依赖关系。

  • 代表:Transformer 编码器的核心机制。

  • 优点:

    • 并行计算:不像循环神经网络,自注意力机制允许并行处理序列中的所有元素,提高了计算效率。
    • 捕捉长距离依赖:自注意力机制能够有效地捕捉序列中长距离的依赖关系。
    • 灵活性:这种机制可以应用于不同类型的序列数据,并且可以容易地扩展到更长的序列。
  1. 多头注意力(Multi-Head Attention)
  • 定义:将注意力机制分成多个“头”,每个头学习不同的表示子空间。
  • 作用:通过并行计算多个注意力头,捕捉序列中不同子空间的依赖关系。
  • 公式:

img其中

其中:

img

  • 优点:

    • 丰富表示能力:每个注意力头可以关注输入序列的不同部分,增强模型的表达能力。
    • 捕捉多种依赖关系:能够同时捕捉短距离和长距离的依赖关系。
  1. 编码器-解码器注意力(Encoder-Decoder Attention / Cross-Attention)
  • 定义:在编码器-解码器注意力机制中,查询(Query)来自解码器,键(Key)和值(Value)来自编码器。

  • 作用:解码器通过注意力机制访问编码器的上下文信息,以生成当前输出。

  • 代表:机器翻译中的 seq2seq + attention。

  • 优点:

    • 增强上下文信息:解码器可以根据编码器的输出动态调整关注的输入部分,提高生成质量。
    • 灵活性:适用于多种序列到序列的任务,如机器翻译、文本摘要等。
  1. 交叉注意力(Cross-Attention)
  • 定义:交叉注意力机制是一种特殊的注意力机制,其中查询(Query)来自一个序列,键(Key)和值(Value)来自另一个序列。

  • 作用:在多模态任务中,交叉注意力可以将不同模态的信息进行融合,例如在图像描述生成中,将图像特征和文本特征进行融合。

  • 代表:视觉-语言模型(如ViLT、BLIP、CLIP)中常用的注意力机制。

  • 优点:

    • 多模态信息融合:能够有效地将不同模态的信息进行融合,提高模型的表现力。
    • 灵活性:适用于多种多模态任务,如图像描述、视觉问答等。

03.Transformer / 自回归模型生成token时什么时候停止?

常见的停止条件(优先级从高到低)

1.生成到特殊的结束标记 EOS(End-Of-Sequence):模型在训练时通常把目标句子末尾标上 ,推理时一旦采样出这个 token 就会停止当前序列的生成。模型预测到 EOS 是最常见的停止信号。

2.达到最大生成长度(max_tokens / max_length):为了防止无限生成,解码循环会设置一个硬上限(比如最多生成 512 token),当到达该上限就强制停止。很多框架把它作为兜底策略。

3.用户 / 应用定义的停止序列(stop sequences):可配置为若出现某个 token 串或文本片段(例如 “\n\n”、某句话结束片段等)就停止。这类停止通常由解码循环或后处理逻辑检测并触发。

4.Beam-search / 并行候选的特殊终止规则:在 beam search 中,停止规则更复杂。总之常见做法是:当满足某些 beam-level 的终止条件(例如主 beam 已生成 EOS,且其他 beam 不可能在概率上超越它)就可以结束搜索。否则直到所有候选 beam 都产生 EOS 或到达长度上限。

04.Transformer的token生成是自回归式的吗?

是的,Transformer 的 token 生成机制是自回归(autoregressive)式的,尤其是在其 Decoder 端。以下详细说明其工作原理与训练 vs 推理行为的差异。

自回归(Autoregressive)是什么意思

在自回归生成中,每一步的 token 预测都依赖于之前生成的所有 token。其数学表达如下:

img

即当前 token 的概率由其前文条件决定,生成时一次预测一个 token。

Transformer 解码器:自回归机制体现

Decoder 的每个位置通过masked self-attention(因果掩码自注意力)确保只能访问前 “已生成” token,而不能看见未来 token。这种设计使得模型生成行为成为典型的自回归式生成:

  • 预测第 1 个 token
  • 把它 Feed 回模型作为第 2 步的输入,继续预测
  • 如此类推,直到结束 token

这种机制允许模型按序生成、一边预测一边更新上下文。

训练 vs 推理行为差异

img

换言之,训练使用“非自回归”策略来加速并稳定训练;而在推理时,它以自回归方式进行生成,逐步输出 token。

总结

  • Transformer Decoder(以及 GPT 系列)在推理阶段确实是自回归式生成。
  • 训练阶段使用非自回归策略(Teacher Forcing + mask),更高效、更稳定。
  • 自回归机制是自然语言生成任务中非常关键的生成策略,依靠 causal mask 保证每一步仅访问已生成内容。

05.Transformer 在中译英任务中的工作流程

  1. Encoder 部分(处理中文输入)
  • 输入中文句子,例如「我爱学习」。
  • Tokenizer 会把它分词成子词(BPE 或 SentencePiece),比如:
["我", "爱", "学习"][101, 2345, 6789, 3456, 102]   # 加上 [CLS]/[SEP] 之类的特殊符号
  • Embedding + 位置编码:

    每个 token 先映射到一个 embedding 向量,再加上位置编码,形成一系列向量。

  • Encoder 多层 Transformer:

    这些向量经过多层 self-attention 和 feedforward 网络,得到 每个 token 的上下文表示。

    最终输出的是 整句所有 token 的隐表示(hidden states),例如矩阵形状是 [序列长度, d_model]。

👉 所以 Encoder 的输出并不是一个「整体句向量」,而是一堆 token 的上下文向量,全部传给 Decoder。

  1. Decoder 部分(生成英文)

Decoder 生成英文句子时有两个关键点:

(a) 自回归生成

  • Decoder 是 自回归(autoregressive)的:

    • 第一步输入 [BOS](句子开始符),预测第一个英文词(例如 “I”)。
    • 第二步输入 [BOS] I,预测下一个词(例如 “love”)。
    • 第三步输入 [BOS] I love,预测下一个词(例如 “learning”)。
    • 直到预测 [EOS](句子结束符),生成停止。

这就是 逐步预测,每次预测都依赖前面已生成的 token。

(b) 使用 Encoder 信息

  • Decoder 内部有两类 attention:
  1. Masked Self-Attention:保证只能看到自己和之前生成的 token(自回归约束)。
    2. Cross-Attention:和 Encoder 的输出交互,去「对齐」中文输入的 token 表示,从而帮助生成正确的英文。

👉 所以,Encoder 的所有 token 表示(整句话的信息)在每一步生成时都能被 Decoder 使用。

  1. 总结
  • Encoder 的输出是 整句所有 token 的上下文向量,会完整传给 Decoder。

  • Decoder 是 自回归式的,一步步生成英文,每次都用:

    • 已生成的英文 token(通过 masked self-attention)
    • 中文句子的所有表示(通过 cross-attention)

如何学习大模型 AI ?

我国在AI大模型领域面临人才短缺,数量与质量均落后于发达国家。2023年,人才缺口已超百万,凸显培养不足。随着Al技术飞速发展,预计到2025年,这一缺口将急剧扩大至400万,严重制约我国Al产业的创新步伐。加强人才培养,优化教育体系,国际合作并进,是破解困局、推动AI发展的关键。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

在这里插入图片描述

2025最新大模型学习路线

明确的学习路线至关重要。它能指引新人起点、规划学习顺序、明确核心知识点。大模型领域涉及的知识点非常广泛,没有明确的学习路线可能会导致新人感到迷茫,不知道应该专注于哪些内容。

对于从来没有接触过AI大模型的同学,我帮大家准备了从零基础到精通学习成长路线图以及学习规划。可以说是最科学最系统的学习路线。

在这里插入图片描述

针对以上大模型的学习路线我们也整理了对应的学习视频教程,和配套的学习资料。

大模型经典PDF书籍

新手必备的大模型学习PDF书单来了!全是硬核知识,帮你少走弯路!

在这里插入图片描述

配套大模型项目实战

所有视频教程所涉及的实战项目和项目源码等
在这里插入图片描述

博主介绍+AI项目案例集锦

MoPaaS专注于Al技术能力建设与应用场景开发,与智学优课联合孵化,培养适合未来发展需求的技术性人才和应用型领袖。

在这里插入图片描述

在这里插入图片描述

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

为什么要学习大模型?

2025人工智能大模型的技术岗位与能力培养随着人工智能技术的迅速发展和应用 , 大模型作为其中的重要组成部分 , 正逐渐成为推动人工智能发展的重要引擎 。大模型以其强大的数据处理和模式识别能力, 广泛应用于自然语言处理 、计算机视觉 、 智能推荐等领域 ,为各行各业带来了革命性的改变和机遇 。

在这里插入图片描述

适合人群

  • 在校学生:包括专科、本科、硕士和博士研究生。学生应具备扎实的编程基础和一定的数学基础,有志于深入AGI大模型行业,希望开展相关的研究和开发工作。
  • IT行业从业人员:包括在职或失业者,涵盖开发、测试、运维、产品经理等职务。拥有一定的IT从业经验,至少1年以上的编程工作经验,对大模型技术感兴趣或有业务需求,希望通过课程提升自身在IT领域的竞争力。
  • IT管理及技术研究领域人员:包括技术经理、技术负责人、CTO、架构师、研究员等角色。这些人员需要跟随技术发展趋势,主导技术创新,推动大模型技术在企业业务中的应用与改造。
  • 传统AI从业人员:包括算法工程师、机器视觉工程师、深度学习工程师等。这些AI技术人才原先从事机器视觉、自然语言处理、推荐系统等领域工作,现需要快速补充大模型技术能力,获得大模型训练微调的实操技能,以适应新的技术发展趋势。
    在这里插入图片描述

课程精彩瞬间

大模型核心原理与Prompt:掌握大语言模型的核心知识,了解行业应用与趋势;熟练Python编程,提升提示工程技能,为Al应用开发打下坚实基础。

在这里插入图片描述

RAG应用开发工程:掌握RAG应用开发全流程,理解前沿技术,提升商业化分析与优化能力,通过实战项目加深理解与应用。 在这里插入图片描述

Agent应用架构进阶实践:掌握大模型Agent技术的核心原理与实践应用,能够独立完成Agent系统的设计与开发,提升多智能体协同与复杂任务处理的能力,为AI产品的创新与优化提供有力支持。
在这里插入图片描述

模型微调与私有化大模型:掌握大模型微调与私有化部署技能,提升模型优化与部署能力,为大模型项目落地打下坚实基础。 在这里插入图片描述

顶尖师资,深耕AI大模型前沿技术

实战专家亲授,让你少走弯路
在这里插入图片描述

一对一学习规划,职业生涯指导

  • 真实商业项目实训
  • 大厂绿色直通车

人才库优秀学员参与真实商业项目实训

以商业交付标准作为学习标准,具备真实大模型项目实践操作经验可写入简历,支持项目背调

在这里插入图片描述
大厂绿色直通车,冲击行业高薪岗位
在这里插入图片描述

文中涉及到的完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐