LLM Architecture Gallery 是什么:新开源模型出来后,先对照架构再决定要不要部署
新开源模型一出来,开发者最容易先去看跑分、看参数量、看别人说好不好用。但真正决定你能不能部署、长上下文贵不贵、MoE 是否划算的,往往是结构本身。Sebastian Raschka 做的 LLM Architecture Gallery 把 100 多个现代 LLM 的结构图、注意力机制、decoder 类型、每 token KV cache 和
config.json链接放到同一页,适合当作日常对照表,而不是又一个榜单。
关键词: LLM Architecture Gallery、Sebastian Raschka、模型架构、MoE、GQA、MLA、Sliding Window Attention、KV Cache、DeepSeek、Gemma、Qwen、开源模型、部署选型
先看结论
- 结论 1: 这个站点不是评测站,也不是模型下载站。它解决的是“新模型出来后,结构到底改了哪一块”。
- 结论 2: 每张卡片都按同一套字段对齐:总参数 / 激活参数、上下文长度、注意力、层配比、每 token KV cache、许可证、发布日期。
- 结论 3: 开发者最该用的不是把 101 个模型从头翻一遍,而是用筛选和双模型对照,先判断它主要改的是
Attention / KV账,还是FFN / MLP账。 - 结论 4: 图鉴里的 KV cache 数字、AA Index 分数都是整理后的对照信息,不能直接当成本地压测结果。
如果只用一句话概括:
先看它怎么搭,再决定要不要下、怎么部署、该测什么。
一、为什么会把这个站点单独写出来
最近开源模型的发布节奏很快。DeepSeek、Qwen、Gemma、Kimi、MiniMax、Nemotron 这些名字,隔几周就会冒出一个新版本。开发者如果还按以前的习惯,每次都从论文、模型卡、GitHub、Hugging Face、别人的解读文章里拼结构,效率会越来越低。
更麻烦的是,现在很多差异已经不在“参数量更大一点”,而在结构配方:
- 有的模型还是 Dense + GQA
- 有的已经变成 MoE,总参数很大,激活参数却不大
- 有的用 Sliding Window,多数层只看局部
- 有的用 MLA,把每个位置的 KV 压得更小
- 有的开始走 hybrid:一部分层是 attention,一部分层是 DeltaNet、Mamba、Lightning Attention
这些词单独看都面熟。真到选型时,缺的往往不是名词解释,而是一张能横着比的表:
这个模型和上一代比,到底改了注意力、改了专家层,还是只改了训练配方?
Sebastian Raschka 的 LLM Architecture Gallery 就是冲着这个问题做的。
站点地址:
https://sebastianraschka.com/llm-architecture-gallery/
页面上写的是 101 个模型,最近一次更新是 2026 年 8 月 29 日。数字会继续变,所以下面提到的模型数量,以你打开当天的页面为准。
二、它到底是什么
作者是 Sebastian Raschka。很多人可能读过他的 Build a Large Language Model (From Scratch),或者看过他那组 LLM 架构对比长文。Gallery 可以理解成这些文章的“可检索版本”:
- 结构图还在
- 解释被压成卡片
- 模型可以筛选、搜索、两两对照
- 每张卡片尽量挂上
config.json、tech report、许可证,有的还有 from-scratch 实现
站点自己的定位写得很清楚:
A curated reference for modern language-model architectures.
也就是说,它是一份人工整理过的架构图鉴。重点是 text-only LLM,以及多模态模型里的 language backbone。视觉、音频、生图那部分,卡片通常不展开。
这个边界很重要。你在里面看到 Gemma 4、Kimi K2.5、MiMo-V2.5,默认先把它理解成“文本 decoder 怎么搭”,不要默认整条多模态链路都画全了。
三、页面上真正值得用的 4 个功能
打开以后,不要一上来把整页卡片往下滚。先看这 4 个入口。
1. 筛选,而不是通读
顶部可以按这些条件收窄:
- 发布时间:最近 6 个月、最近 12 个月、2026、2025、更早
- 总参数:3B 以下、3B 到 15B、15B 到 70B,一直到 500B+
- 架构类型:
Dense、MoE、Hybrid、Recurrent - 公司
- 排序:最新发布、AA Index、体量、公司名
开发者日常最常用的组合其实就两个:
- 看自己能部署的体量,比如
3B to 15B或15B to 70B - 看最近半年新出来的
MoE/Hybrid
2. 双模型对照
这是我认为最有价值的功能。
页面上有 Compare two models。每张卡片也能把当前模型设成 Model A 或 Model B。选完以后,两套结构字段并排出现。
这个功能适合回答一类很具体的问题:
DeepSeek V3和DeepSeek V4-Flash差在哪Gemma 4 26B-A4B和Qwen3.6 35B-A3B谁的 KV 更重DeepSeek R1相对V3,是不是换了骨架
后面这类问题,一张宣传图通常答不清楚,两张对齐的卡片反而快。
3. 单卡字段,而不是故事
每张卡片通常会给出:
- Scale:总参数,MoE 还会写激活参数和激活比例
- Context
- License
- Date
- Decoder type:Dense / Sparse MoE / Sparse hybrid / Recurrent / Hybrid MoE
- Attention:GQA、MLA、SWA、DeltaNet、CSA/HCA、Mamba-2 等
- Layer mix:比如
25 sliding-window + 5 global - KV cache / token(bf16)
- Key detail
- 有的还有 Artificial Analysis Intelligence Index
- Related concepts:
RMSNorm、QK-Norm、MoE、MTP、NoPE
这些字段的价值,不在于“信息更多”,而在于同一套尺子。你拿 Gemma 4 和 DeepSeek V4 比 KV,至少比自己从两篇风格完全不同的博客里抠数字更稳。
4. 源码和长文入口
卡片下面经常能点到:
config.json- tech report
- license
- 部分模型的 from-scratch 实现
页面底部还挂了几篇作者自己的长文:
- The Big LLM Architecture Comparison
- From GPT-2 to gpt-oss
- From DeepSeek V3 to V3.2
- A Dream of Spring for Open-Weight LLMs
可以记成:
Gallery 负责速查,长文负责讲“为什么这样设计”。
另外还有 Changes 和 RSS。跟新模型发布时,比每次整页重搜更省事。
四、一张卡片该怎么读:先对上三本账
如果只是把卡片当百科看,这个站点的利用率其实不高。更有用的读法,是把它映射到推理成本的三本账上。
只要主干还是 Transformer,大多数结构变化都会落到这三处:
- Attention / KV:上下文怎么交互,KV cache 怎么存、怎么读
- FFN / MLP:每 token 激活多少权重,专家怎么路由
- 系统调度:MTP、speculative decoding、稀疏注意力实现,最后还是要看框架支不支持
对应到 Gallery 字段,大概是这样:
| 你真正关心的问题 | 先看卡片上的哪几项 |
|---|---|
| 这个模型本地能不能放下 | Scale 里的总参数 / 激活参数,再加上 KV cache / token |
| 长上下文会不会把显存和带宽打爆 | Context、Attention、Layer mix、KV cache / token |
| MoE 是不是真的更省 | Decoder type、active params、expert 数量和 top-k |
| 它是不是换了骨架,还是只换了训练 | Key detail,以及和上一代的对照 |
| 值不值得拉到 llama.cpp / vLLM / SGLang 上试 | Attention 类型、MTP、hybrid 备注 |
这里要先把证据边界说清楚。
Gallery 里的 KV cache / token 是按 bf16、每个 token 估算出来的对照值,旁边会标 Very low / Low / Moderate / High / Very high。它适合比较相对高低,不适合直接写成你机器上的显存占用。量化精度、框架实现、sliding window 会不会真正 evict KV,都会让这个数字对不上。
AA Index 也一样。它是能力分,不是 TTFT、不是 decode tokens/s,也不是单卡并发。
所以我建议把 Gallery 的输出理解成:
结构假设,不是部署结论。
五、用两个开发者熟悉的对照,看它怎么帮你省时间
空讲字段不够直观。下面用 Gallery 里已经写明的两组对比,说明它实际怎么用。
对照 1:Gemma 4 26B-A4B vs Qwen3.6 35B-A3B
这两个模型体量接近,都常被拿来讨论“单卡 24GB / 48GB 能不能上”。Gallery 给出的结构差,比“都是 30B 附近的 MoE”这句话有用得多。
Gemma 4 26B-A4B:
25.2B total / 3.8B active
256K context
Sparse MoE
GQA + QK-Norm + 5:1 sliding-window/global attention
25 sliding-window + 5 global
KV cache / token (bf16): 210 KiB · High
128 experts,8 routed + 1 shared
Qwen3.6 35B-A3B:
35B total / 3B active
262K context
Sparse hybrid
3:1 Gated DeltaNet + Gated Attention
10 gated attention + 30 DeltaNet
KV cache / token (bf16): 20 KiB · Very low
256 experts,8 routed + 1 shared
两边都是 MoE,激活参数都在 3B 附近。真正拉开差距的是 Attention / KV 账。
Gemma 4 26B-A4B 仍然走 hybrid sliding window:多数层看局部,少数层看全局。这个设计规则清楚,但 Gallery 给它标的 KV 是 210 KiB · High。原因也不难理解:GQA 还在,全局层还在,窗口外 KV 会不会被丢掉,还取决于推理实现。
Qwen3.6 35B-A3B 把大部分层换成了 Gated DeltaNet,只留四分之一左右的 gated attention。Gallery 给它标的 KV 直接掉到 20 KiB · Very low。也就是说,它不是靠“更小的 MoE”省钱,而是靠 hybrid attention 把历史访问成本压下去。
如果只看总参数,你会觉得 Qwen3.6 更大;如果只看激活参数,两者差不多。对照完结构后,更合理的下一问变成:
我的框架能不能稳定跑 DeltaNet / hybrid attention?还是 Gemma 这条 sliding window 路线更好落地?
这就是 Gallery 的价值:它把“要不要试”变成“该先验证哪一类风险”。
对照 2:DeepSeek V3 vs DeepSeek V4-Flash
再看一条更明显的架构升级。
DeepSeek V3:
671B total / 37B active
128K context
Sparse MoE
MLA
61 MLA
KV cache / token (bf16): 68.6 KiB · Low
DeepSeek V4-Flash:
284B total / 13B active
1,048,576 context
Sparse MoE
MLA-style CSA/HCA with mHC
43 CSA/HCA
KV cache / token (bf16): 5.4 KiB · Very low
V3 已经靠 MLA 把 KV 压到比较低的水平。V4-Flash 继续往下走:总参数和激活参数都更小,上下文直接标到 1M,KV 从 68.6 KiB 掉到 5.4 KiB。卡片上的 Key detail 也写了 hash-based routing、compressed attention、V4 的 MTP 路径。
所以这不是“同一个 DeepSeek 模板再发一版”,而是 Attention / KV 账又换了一层:从 MLA 的“每个 KV 存得更小”,走到 CSA/HCA 的“超长历史怎么压缩和稀疏访问”。
这里也能顺便避免一个常见误读。Gallery 里 DeepSeek R1 的结构和 V3 基本对齐,Key detail 写得很直白:主变化是推理导向的训练配方,不是新骨架。Kimi K2.6 相对 K2.5、INTELLECT-3 相对 GLM-4.5-Air,也有类似提示。
这对开发者很实用:
别把后训练收益,误读成架构升级。
六、一个可以直接复用的使用流程
新模型发布时,我建议按这个顺序用,而不是把 Gallery 当首页新闻刷。
第一步:先搜名字,确认它在不在图鉴里。
在就继续;不在也不奇怪,站点是人工维护的,更新会有窗口。这时再退回模型卡和 config.json。
第二步:先看 Decoder type 和 Attention,不要先看 AA 分数。
先判断它落在哪一类:
- Dense
- Sparse MoE
- Sparse hybrid / Hybrid MoE
- Recurrent
再看注意力是 GQA、MLA、SWA、DeltaNet、Mamba,还是 CSA/HCA。这一步决定后面的部署假设。
第三步:把上一代或同体量模型拉进 Compare。
尽量找最近的参照物,而不是和 GPT-2 比。比如:
- 同系列:
Qwen3.5vsQwen3.6,DeepSeek V3.2vsV4-Flash - 同体量:
Gemma 4 26B-A4BvsQwen3.6 35B-A3B - 同任务:两个 coding MoE
第四步:只记 4 个数字。
- 总参数
- 激活参数
- 上下文长度
- KV cache / token 的相对档位
有这 4 个,再加上注意力类型,通常就够判断:这是一个“权重账更重”的模型,还是一个“KV 账更重”的模型。
第五步:点开 config.json,核对自己真正要部署的那个 checkpoint。
Gallery 是对照表,不是唯一真相。同系列里 instruct / thinking / coder / multimodal 可能共用一个 backbone,也可能有小差异。本地部署前,还是以实际仓库里的配置为准。
第六步:再决定测什么。
结构看完以后,压测题会清楚很多:
- 如果 KV 被标成
Very high,优先测长上下文和并发,不要只测短 prompt 单请求 - 如果是 hybrid / DeltaNet / Mamba,优先测框架兼容和长文本召回,不要默认 llama.cpp、vLLM、SGLang 都一样熟
- 如果是 MoE 且激活很小,优先测专家路由、batch 变化后的吞吐,不要只看 active params 就判断显存一定小
- 如果卡片写“结构没变,变的是训练”,就别在架构层重复验证,直接看任务质量和后训练行为
七、它解决不了什么
把边界写清楚,这个站点会更好用。
它不告诉你这个模型好不好用。
AA Index 可以当参考,但开发者真正要的编码、工具调用、长文档问答、中文效果,还是得看任务,不能看总分。
它不告诉你你的机器跑不跑得动。
总参数、激活参数、KV/token 只是结构线索。量化、上下文、并发、框架实现,都会改最终显存和速度。
它不覆盖完整多模态系统。
视觉编码器、音频编码器、生图模块,通常被省略。看 Gemma 4 12B Unified 这类卡片时,页面自己也会提醒:图上画的是文本 decoder。
它不是论文替代品。
CSA/HCA、mHC、IndexShare、LatentMoE 这些词,卡片只会点到机制方向。要理解训练稳定性和推理 kernel,还是得回到 tech report。
数字可能和你本地对不上。
这不是站点质量问题,而是对照表的正常限制。你要是拿 Gallery 的 210 KiB 去反推 24GB 显卡能开多长 context,中间还差量化、框架、KV 是否按窗口丢弃、还有 runtime buffer。
纠错方面,站点写了欢迎去 issue tracker 提修正。如果页面看起来不是最新,作者建议硬刷新:macOS 用 Command + Shift + R,Windows 用 Ctrl + F5。
八、开发者可以怎么把它嵌进日常工作
如果只是收藏一个链接,这个站点过两周就容易忘。更稳的用法是把它嵌进已有工作流。
写部署笔记前,先截一张对照。
比如准备测 Gemma 4 26B-A4B,先把它和 Qwen3.6 35B-A3B 或 gpt-oss-20b 并排看完,再写“为什么选这个模型、主要风险在哪”。这样后面的压测不会写成流水账。
新模型发布时,先分类,再决定要不要跟。
有的发布只是同骨架换了后训练,跟不跟取决于任务;有的发布换了注意力或专家层,跟不跟取决于你的推理栈能不能接住。Gallery 能帮你先做这个分流。
和自己的 config.json 阅读习惯对齐。
如果你已经会看 num_attention_heads、num_key_value_heads、sliding_window、num_experts、num_experts_per_tok,Gallery 相当于把这些字段翻译成了人能扫的卡片。两者一起用最好:卡片找方向,配置文件做核对。
不要用它替代本地验证。
结构对照能减少无效下载和无效争论,但不能替代 TTFT、decode 速度、长上下文召回、并发掉速这些实测。该测的还是得测。
九、最后总结
LLM Architecture Gallery 的价值,不是又提供了一个“模型很全”的页面,而是把现代 LLM 的结构差,收成开发者能反复打开的对照表。
它适合回答这些问题:
- 这个模型是 Dense、MoE,还是 hybrid
- 它主要改了注意力,还是改了专家层
- 长上下文时,KV 看起来贵不贵
- 和上一代比,换的是骨架还是训练配方
- 下一步该去读
config.json,还是直接安排压测
它不适合回答这些问题:
- 这个模型综合排名第几
- 我这张 4090 / L20 一定能跑
- 业务里中文效果、工具调用、Agent 稳不稳
站点本身也还在更新。模型数量、卡片字段、对照工具后面都可能变。使用时以页面当前内容为准,重要结论再回到原始 config.json 和 tech report 核对。
如果只记住一个用法:
新模型出来后,先把它和最近的参照物丢进 Compare。看完 Decoder type、Attention、激活参数和 KV 档位,再决定要不要下载、用什么框架、先测哪一类风险。
更多推荐

所有评论(0)