大模型知识汇总、学习路线
第一部分:Transformer结构
1.分词器tokenizer&Embedding层
BPE、BBPE、WordPiece等算法,了解一下各类模型的分词方法
tokenizer在预训练过程具体如何处理
2、注意力模块
self-attention,cross-attention的原理MHA、MQA、GQA、MLA、DCA等多种注意力机制优化策略,线性注意力,稀疏注意力,kvcache等等,(苏神的科学空间)
3、前馈神经网络FFN&残差连接&归一化
各个模块的作用,LN和BN的区别,pre-norm和post-norm,SwiGLU等激活函数,RMSNorm等归一化。
把 Transformer / Decoder‑only 的整体结构过一遍,各个组件分别在干什么,有哪些常见变体。
【一句话总结】
Transformer/Decoder-only 结构是一个基于自回归建模的堆叠式神经网络,其核心是通过掩码自注意力(Masked Self-Attention)和前馈网络(FFN) 层层堆叠,配合残差连接与层归一化,实现对序列数据的强大表征和生成能力;常见变体主要在注意力机制、位置编码和激活函数上进行优化,以提升效率、稳定性和长程依赖处理能力。

Attention 机制是线性加权组合(softmax + weighted sum),本身缺乏非线性建模能力。FFN 引入非线性(如 ReLU/GELU),使模型能拟合更复杂的函数。


4、位置编码PE
为什么需要位置编码,常见的位置编码有哪些,如正余弦、可学习、ROPE、ALiBi.YARN等,绝对位置编码和相对位置编码长度外推策略,了解各大模型长上下文处理方式。
1、Transformer模型的核心是自注意力机制。自注意力通过计算所有词元对之间的相关性来构建上下文表示,这个过程本质上是排列不变的(位置无关的)。
位置编码的作用就是向模型注入词元在序列中绝对或相对位置的信息,打破自注意力的排列不变性,使模型能够理解语言的顺序性。
2、绝对位置编码:为序列中的每个绝对位置(如第1个词、第2个词)分配一个固定的或可学习的向量表示,然后直接与词向量相加。长度外推能力差:模型无法处理比训练时更长的序列,性能会急剧下降。
3、相对位置编码:不关注词的绝对位置,而是关注词与词之间的相对距离(如偏移量△ = i-j)。将这种相对位置信息编码成一个偏置项,添加到注意力评分中。
4、旋转位置编码 (RoPE):通过一个旋转矩阵对查询(Q)和键(K)向量进行变换,使得它们的点积结果天然包含了相对位置信息。即,通过“旋转”向量来编码位置。
同时具备绝对和相对位置的优点:在短序列上表现良好,同时拥有极佳的长度外推能力。可以通过微调甚至零样本的方式处理远长于训练时的序列。
YaRN(Yet another RoPE extensioN)解决RoPE在长度外推时的局限性。
5、长度外推问题:指模型在训练时只见过较短序列(如2K),但在推理时能否有效处理更长序列(如8K)的能力。
NTK-aware 插值
RoPE的不同维度捕获了不同频率的信息(高频捕捉局部,低频捕捉全局)。因此,它不对所有维度进行同等缩放,而是对高频信息(对应RoPE的底层维度)进行较少缩放,对低频信息(高层维度)进行较多缩放。
YaRN 微调
结合了NTK-aware插值和温度缩放,并使用少量长文本数据对模型进行有监督微调。
位置编码这条线你怎么选:绝对 PE、相对 PE、RoPE 各自的思路、优势和局限,结合你的项目谈取舍。
根据任务对位置信息的敏感度、序列长度需求和计算开销来选:绝对PE用于简单短序列任务(如分类),相对PE用于对位置关系敏感的任务(如音乐生成),RoPE因其强大的外推性和性能成为长序列、生成式任务(如LLM、长文本处理)的首选。
5、代表模型
encode-only,decode-only,encode-decode,prefix-decode等结构及其代表模型,分别适用于哪些任务,为什么现在的大模型都是decode-only结构
encode-only:
结构:只使用Transformer的编码器部分。编码器的自注意力层是双向的,即每个词元可以关注到输入序列中的所有其他词元(包括前后的词)。
核心能力:理解与表示。它擅长对整个输入序列进行深度理解和编码,生成一个富含上下文信息的表示。
BERT系列:通过掩码语言建模预训练,随机遮盖输入中的一些词,让模型根据上下文来预测它们。
适用任务:
自然语言理解任务:文本分类、情感分析。
序列标注任务:命名实体识别、词性标注。
语义相似度计算:判断两个句子的语义是否相近。
抽取式问答:从给定的文本中抽取答案片段。
这些任务都需要模型充分理解输入文本的整体含义和内部词元间的复杂关系,双向注意力机制为此提供了完美支持。
decode-only:只使用Transformer的解码器部分。关键区别在于其自注意力层是因果的或掩码的,即每个词元只能关注它之前的词元(包括自己),而不能看到未来的信息。
核心能力:自回归生成。给定一个上文,预测下一个最可能的词元,并依此类推,逐个生成后续内容。
GPT系列、LLaMA系列、Bloom、PaLM 等绝大多数当前的大语言模型。
适用任务:
文本生成:写文章、写邮件、写代码。
对话系统:ChatBot。
开放式问答:根据知识生成答案。
代码补全:根据已有代码预测下一行。
为什么适用:这些任务的本质是序列生成,模型需要根据已有的内容来创造接下来的内容,因果注意力完美地模拟了这个过程。
为什么现在的大模型都是Decoder-only结构?
1. Scaling Laws
现象:当计算量、模型参数量、数据量同步扩大时,Decoder-only模型展现出了最稳定和可预测的性能增长规律。
原因:自回归的下一词预测任务是一个极其困难但又定义明确的任务,它迫使模型学习世界知识、逻辑推理、语言语法等一切内容。模型越大,数据越多,它在这个任务上就做得越好,而这种能力的泛化性极强。
2. 任务的统一性和通用性
分类任务、问答任务、翻译任务、推理任务
Decoder-only架构原生就是为生成设计的,通过巧妙的提示工程,它可以 zero-shot 或 few-shot 地适应上述所有任务,而无需改变模型架构。这种统一性极大地简化了训练和部署流程。
3. 训练与推理的高效性
只有一套参数,无需像Encoder-Decoder那样维护两套复杂的交互机制(交叉注意力),这使得模型设计和实现更简单。
4. 强大的涌现能力
思维链、指令遵循等,在足够大规模的Decoder-only模型中表现得最为明显。
6、解码器策略
top-k、top-p、temperature等参数含义greedy search、beam search等解码策略投机策略及其优化算法
1. Temperature: 控制输出分布的随机性。它是在计算softmax之前,除以概率对数的一个因子。
T = 1:保持原始概率分布,不做任何改变。
T < 1(如 0.2~0.8):降低随机性。让高概率的词更高,低概率的词更低。模型输出更集中、更确定、更保守。适用于需要事实准确、格式规范的任务(如代码生成、问答)。
T > 1(如 1.2~2.0):增加随机性。让概率分布更平缓,低概率词也有机会被选中。模型输出更富有创造力、更出人意料,但也可能更不连贯。适用于创意写作、诗歌生成等。
2. Top-p: 也称为核采样。它解决了Top-k的固定数量问题。Top-p从概率最高的词开始累积,直到累积概率刚刚超过p,然后只从这些词构成的集合中采样。
3. Greedy Search: 在每一步都简单地选择概率最高的那个词。容易生成重复、乏味的文本,不是全局最优。
4. Beam Search: 贪婪搜索的扩展,它每一步保留概率最高的 b(beam size)个候选序列,而不是1个。
5. 投机策略:
问题:大模型(Target Model)自回归生成token速度慢,因为必须一个一个地生成,无法并行。
洞察:虽然生成一个复杂的、新颖的句子很难,但验证一个给定的句子是否合理要容易得多。
“草稿模型”生成的候选序列,大模型验证,正确token接受,不一致token拒绝后续所有,重复过程。生成慢,验证快。
第二部分:主流大模型
BERT系列、GPT、Llama、Qwen、GLM、Baichuan、DeepSeek等等,注意关注发展脉络,每一代做了哪些优化
第三部分:预训练Pre-train过程
预训练任务有哪些、数据配比、数据筛选过滤方法、合成数据,推荐阅读主流大模型开源的技术报告
第四部分:后训练Post-train过程
1、SFT
微调数据构造、数据配比、全参微调、冻结微调、PEFT(prompt tuning、p-tuningv2、prefix-tuning、adapter-tuning、LoRA及其变体)
CoT、Reasoning等o1系列策略
2、RLHF&Aligning
为什么有SFT还需要RLHF,两者有何区别RLAIF、ReFT、OpenAI做RLHF的过程的几个模型分别是怎么运作的,DPO的原理和实现、PPO和DPO对比,DPO有哪些问题以及如何优化,SimPO、KTO、ORPO、GRPO等等
第五部分:模型压缩与量化
了解各种量化方式,GPTQ、AWQ等,各种量化精度,训练显存计算
第六部分:专家模型MOE
了解MOE结构及其原理,训练思路,推荐看知乎上关于MOE的万字长文
第七部分:RAG&Agent
借助LangChain框架学习RAG流程,了解文档分块、向量模型训练、多种检索策略等关键步骤;,Agent的几个框架,如ReAct、Reflexion等基本思路
更多推荐

所有评论(0)