新开源模型一出来,开发者最容易先去看跑分、看参数量、看别人说好不好用。但真正决定你能不能部署、长上下文贵不贵、MoE 是否划算的,往往是结构本身。Sebastian Raschka 做的 LLM Architecture Gallery 把 100 多个现代 LLM 的结构图、注意力机制、decoder 类型、每 token KV cache 和 config.json 链接放到同一页,适合当作日常对照表,而不是又一个榜单。

关键词: LLM Architecture Gallery、Sebastian Raschka、模型架构、MoE、GQA、MLA、Sliding Window Attention、KV Cache、DeepSeek、Gemma、Qwen、开源模型、部署选型

先看结论

  • 结论 1: 这个站点不是评测站,也不是模型下载站。它解决的是“新模型出来后,结构到底改了哪一块”。
  • 结论 2: 每张卡片都按同一套字段对齐:总参数 / 激活参数、上下文长度、注意力、层配比、每 token KV cache、许可证、发布日期。
  • 结论 3: 开发者最该用的不是把 101 个模型从头翻一遍,而是用筛选和双模型对照,先判断它主要改的是 Attention / KV 账,还是 FFN / MLP 账。
  • 结论 4: 图鉴里的 KV cache 数字、AA Index 分数都是整理后的对照信息,不能直接当成本地压测结果。

如果只用一句话概括:

先看它怎么搭,再决定要不要下、怎么部署、该测什么。

一、为什么会把这个站点单独写出来

最近开源模型的发布节奏很快。DeepSeek、Qwen、Gemma、Kimi、MiniMax、Nemotron 这些名字,隔几周就会冒出一个新版本。开发者如果还按以前的习惯,每次都从论文、模型卡、GitHub、Hugging Face、别人的解读文章里拼结构,效率会越来越低。

更麻烦的是,现在很多差异已经不在“参数量更大一点”,而在结构配方:

  • 有的模型还是 Dense + GQA
  • 有的已经变成 MoE,总参数很大,激活参数却不大
  • 有的用 Sliding Window,多数层只看局部
  • 有的用 MLA,把每个位置的 KV 压得更小
  • 有的开始走 hybrid:一部分层是 attention,一部分层是 DeltaNet、Mamba、Lightning Attention

这些词单独看都面熟。真到选型时,缺的往往不是名词解释,而是一张能横着比的表:

这个模型和上一代比,到底改了注意力、改了专家层,还是只改了训练配方?

Sebastian Raschka 的 LLM Architecture Gallery 就是冲着这个问题做的。

站点地址:

https://sebastianraschka.com/llm-architecture-gallery/

页面上写的是 101 个模型,最近一次更新是 2026 年 8 月 29 日。数字会继续变,所以下面提到的模型数量,以你打开当天的页面为准。

二、它到底是什么

作者是 Sebastian Raschka。很多人可能读过他的 Build a Large Language Model (From Scratch),或者看过他那组 LLM 架构对比长文。Gallery 可以理解成这些文章的“可检索版本”:

  • 结构图还在
  • 解释被压成卡片
  • 模型可以筛选、搜索、两两对照
  • 每张卡片尽量挂上 config.json、tech report、许可证,有的还有 from-scratch 实现

站点自己的定位写得很清楚:

A curated reference for modern language-model architectures.

也就是说,它是一份人工整理过的架构图鉴。重点是 text-only LLM,以及多模态模型里的 language backbone。视觉、音频、生图那部分,卡片通常不展开。

这个边界很重要。你在里面看到 Gemma 4Kimi K2.5MiMo-V2.5,默认先把它理解成“文本 decoder 怎么搭”,不要默认整条多模态链路都画全了。

三、页面上真正值得用的 4 个功能

打开以后,不要一上来把整页卡片往下滚。先看这 4 个入口。

1. 筛选,而不是通读

顶部可以按这些条件收窄:

  • 发布时间:最近 6 个月、最近 12 个月、2026、2025、更早
  • 总参数:3B 以下、3B 到 15B、15B 到 70B,一直到 500B+
  • 架构类型:DenseMoEHybridRecurrent
  • 公司
  • 排序:最新发布、AA Index、体量、公司名

开发者日常最常用的组合其实就两个:

  • 看自己能部署的体量,比如 3B to 15B15B to 70B
  • 看最近半年新出来的 MoE / Hybrid

2. 双模型对照

这是我认为最有价值的功能。

页面上有 Compare two models。每张卡片也能把当前模型设成 Model A 或 Model B。选完以后,两套结构字段并排出现。

这个功能适合回答一类很具体的问题:

  • DeepSeek V3DeepSeek V4-Flash 差在哪
  • Gemma 4 26B-A4BQwen3.6 35B-A3B 谁的 KV 更重
  • DeepSeek R1 相对 V3,是不是换了骨架

后面这类问题,一张宣传图通常答不清楚,两张对齐的卡片反而快。

3. 单卡字段,而不是故事

每张卡片通常会给出:

  • Scale:总参数,MoE 还会写激活参数和激活比例
  • Context
  • License
  • Date
  • Decoder type:Dense / Sparse MoE / Sparse hybrid / Recurrent / Hybrid MoE
  • Attention:GQA、MLA、SWA、DeltaNet、CSA/HCA、Mamba-2 等
  • Layer mix:比如 25 sliding-window + 5 global
  • KV cache / token(bf16)
  • Key detail
  • 有的还有 Artificial Analysis Intelligence Index
  • Related concepts:RMSNormQK-NormMoEMTPNoPE

这些字段的价值,不在于“信息更多”,而在于同一套尺子。你拿 Gemma 4DeepSeek V4 比 KV,至少比自己从两篇风格完全不同的博客里抠数字更稳。

4. 源码和长文入口

卡片下面经常能点到:

  • config.json
  • tech report
  • license
  • 部分模型的 from-scratch 实现

页面底部还挂了几篇作者自己的长文:

可以记成:

Gallery 负责速查,长文负责讲“为什么这样设计”。

另外还有 Changes 和 RSS。跟新模型发布时,比每次整页重搜更省事。

四、一张卡片该怎么读:先对上三本账

如果只是把卡片当百科看,这个站点的利用率其实不高。更有用的读法,是把它映射到推理成本的三本账上。

只要主干还是 Transformer,大多数结构变化都会落到这三处:

  1. Attention / KV:上下文怎么交互,KV cache 怎么存、怎么读
  2. FFN / MLP:每 token 激活多少权重,专家怎么路由
  3. 系统调度:MTP、speculative decoding、稀疏注意力实现,最后还是要看框架支不支持

对应到 Gallery 字段,大概是这样:

你真正关心的问题先看卡片上的哪几项
这个模型本地能不能放下Scale 里的总参数 / 激活参数,再加上 KV cache / token
长上下文会不会把显存和带宽打爆Context、Attention、Layer mix、KV cache / token
MoE 是不是真的更省Decoder type、active params、expert 数量和 top-k
它是不是换了骨架,还是只换了训练Key detail,以及和上一代的对照
值不值得拉到 llama.cpp / vLLM / SGLang 上试Attention 类型、MTP、hybrid 备注

这里要先把证据边界说清楚。

Gallery 里的 KV cache / token 是按 bf16、每个 token 估算出来的对照值,旁边会标 Very low / Low / Moderate / High / Very high。它适合比较相对高低,不适合直接写成你机器上的显存占用。量化精度、框架实现、sliding window 会不会真正 evict KV,都会让这个数字对不上。

AA Index 也一样。它是能力分,不是 TTFT、不是 decode tokens/s,也不是单卡并发。

所以我建议把 Gallery 的输出理解成:

结构假设,不是部署结论。

五、用两个开发者熟悉的对照,看它怎么帮你省时间

空讲字段不够直观。下面用 Gallery 里已经写明的两组对比,说明它实际怎么用。

对照 1:Gemma 4 26B-A4B vs Qwen3.6 35B-A3B

这两个模型体量接近,都常被拿来讨论“单卡 24GB / 48GB 能不能上”。Gallery 给出的结构差,比“都是 30B 附近的 MoE”这句话有用得多。

Gemma 4 26B-A4B

25.2B total / 3.8B active
256K context
Sparse MoE
GQA + QK-Norm + 5:1 sliding-window/global attention
25 sliding-window + 5 global
KV cache / token (bf16): 210 KiB · High
128 experts,8 routed + 1 shared

Qwen3.6 35B-A3B

35B total / 3B active
262K context
Sparse hybrid
3:1 Gated DeltaNet + Gated Attention
10 gated attention + 30 DeltaNet
KV cache / token (bf16): 20 KiB · Very low
256 experts,8 routed + 1 shared

两边都是 MoE,激活参数都在 3B 附近。真正拉开差距的是 Attention / KV 账。

Gemma 4 26B-A4B 仍然走 hybrid sliding window:多数层看局部,少数层看全局。这个设计规则清楚,但 Gallery 给它标的 KV 是 210 KiB · High。原因也不难理解:GQA 还在,全局层还在,窗口外 KV 会不会被丢掉,还取决于推理实现。

Qwen3.6 35B-A3B 把大部分层换成了 Gated DeltaNet,只留四分之一左右的 gated attention。Gallery 给它标的 KV 直接掉到 20 KiB · Very low。也就是说,它不是靠“更小的 MoE”省钱,而是靠 hybrid attention 把历史访问成本压下去。

如果只看总参数,你会觉得 Qwen3.6 更大;如果只看激活参数,两者差不多。对照完结构后,更合理的下一问变成:

我的框架能不能稳定跑 DeltaNet / hybrid attention?还是 Gemma 这条 sliding window 路线更好落地?

这就是 Gallery 的价值:它把“要不要试”变成“该先验证哪一类风险”。

对照 2:DeepSeek V3 vs DeepSeek V4-Flash

再看一条更明显的架构升级。

DeepSeek V3

671B total / 37B active
128K context
Sparse MoE
MLA
61 MLA
KV cache / token (bf16): 68.6 KiB · Low

DeepSeek V4-Flash

284B total / 13B active
1,048,576 context
Sparse MoE
MLA-style CSA/HCA with mHC
43 CSA/HCA
KV cache / token (bf16): 5.4 KiB · Very low

V3 已经靠 MLA 把 KV 压到比较低的水平。V4-Flash 继续往下走:总参数和激活参数都更小,上下文直接标到 1M,KV 从 68.6 KiB 掉到 5.4 KiB。卡片上的 Key detail 也写了 hash-based routing、compressed attention、V4 的 MTP 路径。

所以这不是“同一个 DeepSeek 模板再发一版”,而是 Attention / KV 账又换了一层:从 MLA 的“每个 KV 存得更小”,走到 CSA/HCA 的“超长历史怎么压缩和稀疏访问”。

这里也能顺便避免一个常见误读。Gallery 里 DeepSeek R1 的结构和 V3 基本对齐,Key detail 写得很直白:主变化是推理导向的训练配方,不是新骨架。Kimi K2.6 相对 K2.5INTELLECT-3 相对 GLM-4.5-Air,也有类似提示。

这对开发者很实用:

别把后训练收益,误读成架构升级。

六、一个可以直接复用的使用流程

新模型发布时,我建议按这个顺序用,而不是把 Gallery 当首页新闻刷。

第一步:先搜名字,确认它在不在图鉴里。

在就继续;不在也不奇怪,站点是人工维护的,更新会有窗口。这时再退回模型卡和 config.json

第二步:先看 Decoder type 和 Attention,不要先看 AA 分数。

先判断它落在哪一类:

  • Dense
  • Sparse MoE
  • Sparse hybrid / Hybrid MoE
  • Recurrent

再看注意力是 GQA、MLA、SWA、DeltaNet、Mamba,还是 CSA/HCA。这一步决定后面的部署假设。

第三步:把上一代或同体量模型拉进 Compare。

尽量找最近的参照物,而不是和 GPT-2 比。比如:

  • 同系列:Qwen3.5 vs Qwen3.6DeepSeek V3.2 vs V4-Flash
  • 同体量:Gemma 4 26B-A4B vs Qwen3.6 35B-A3B
  • 同任务:两个 coding MoE

第四步:只记 4 个数字。

  • 总参数
  • 激活参数
  • 上下文长度
  • KV cache / token 的相对档位

有这 4 个,再加上注意力类型,通常就够判断:这是一个“权重账更重”的模型,还是一个“KV 账更重”的模型。

第五步:点开 config.json,核对自己真正要部署的那个 checkpoint。

Gallery 是对照表,不是唯一真相。同系列里 instruct / thinking / coder / multimodal 可能共用一个 backbone,也可能有小差异。本地部署前,还是以实际仓库里的配置为准。

第六步:再决定测什么。

结构看完以后,压测题会清楚很多:

  • 如果 KV 被标成 Very high,优先测长上下文和并发,不要只测短 prompt 单请求
  • 如果是 hybrid / DeltaNet / Mamba,优先测框架兼容和长文本召回,不要默认 llama.cpp、vLLM、SGLang 都一样熟
  • 如果是 MoE 且激活很小,优先测专家路由、batch 变化后的吞吐,不要只看 active params 就判断显存一定小
  • 如果卡片写“结构没变,变的是训练”,就别在架构层重复验证,直接看任务质量和后训练行为

七、它解决不了什么

把边界写清楚,这个站点会更好用。

它不告诉你这个模型好不好用。

AA Index 可以当参考,但开发者真正要的编码、工具调用、长文档问答、中文效果,还是得看任务,不能看总分。

它不告诉你你的机器跑不跑得动。

总参数、激活参数、KV/token 只是结构线索。量化、上下文、并发、框架实现,都会改最终显存和速度。

它不覆盖完整多模态系统。

视觉编码器、音频编码器、生图模块,通常被省略。看 Gemma 4 12B Unified 这类卡片时,页面自己也会提醒:图上画的是文本 decoder。

它不是论文替代品。

CSA/HCAmHCIndexShareLatentMoE 这些词,卡片只会点到机制方向。要理解训练稳定性和推理 kernel,还是得回到 tech report。

数字可能和你本地对不上。

这不是站点质量问题,而是对照表的正常限制。你要是拿 Gallery 的 210 KiB 去反推 24GB 显卡能开多长 context,中间还差量化、框架、KV 是否按窗口丢弃、还有 runtime buffer。

纠错方面,站点写了欢迎去 issue tracker 提修正。如果页面看起来不是最新,作者建议硬刷新:macOS 用 Command + Shift + R,Windows 用 Ctrl + F5

八、开发者可以怎么把它嵌进日常工作

如果只是收藏一个链接,这个站点过两周就容易忘。更稳的用法是把它嵌进已有工作流。

写部署笔记前,先截一张对照。

比如准备测 Gemma 4 26B-A4B,先把它和 Qwen3.6 35B-A3Bgpt-oss-20b 并排看完,再写“为什么选这个模型、主要风险在哪”。这样后面的压测不会写成流水账。

新模型发布时,先分类,再决定要不要跟。

有的发布只是同骨架换了后训练,跟不跟取决于任务;有的发布换了注意力或专家层,跟不跟取决于你的推理栈能不能接住。Gallery 能帮你先做这个分流。

和自己的 config.json 阅读习惯对齐。

如果你已经会看 num_attention_headsnum_key_value_headssliding_windownum_expertsnum_experts_per_tok,Gallery 相当于把这些字段翻译成了人能扫的卡片。两者一起用最好:卡片找方向,配置文件做核对。

不要用它替代本地验证。

结构对照能减少无效下载和无效争论,但不能替代 TTFT、decode 速度、长上下文召回、并发掉速这些实测。该测的还是得测。

九、最后总结

LLM Architecture Gallery 的价值,不是又提供了一个“模型很全”的页面,而是把现代 LLM 的结构差,收成开发者能反复打开的对照表。

它适合回答这些问题:

  • 这个模型是 Dense、MoE,还是 hybrid
  • 它主要改了注意力,还是改了专家层
  • 长上下文时,KV 看起来贵不贵
  • 和上一代比,换的是骨架还是训练配方
  • 下一步该去读 config.json,还是直接安排压测

它不适合回答这些问题:

  • 这个模型综合排名第几
  • 我这张 4090 / L20 一定能跑
  • 业务里中文效果、工具调用、Agent 稳不稳

站点本身也还在更新。模型数量、卡片字段、对照工具后面都可能变。使用时以页面当前内容为准,重要结论再回到原始 config.json 和 tech report 核对。

如果只记住一个用法:

新模型出来后,先把它和最近的参照物丢进 Compare。看完 Decoder type、Attention、激活参数和 KV 档位,再决定要不要下载、用什么框架、先测哪一类风险。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐