前言



2026 年 9 月的国产大模型战场 , 核心问题已经不是 " 谁更强 “ , 而是 ” 旗舰与蒸馏之间那道裂缝到底有多大 " ;

过去半年 , 阿里、腾讯、智谱、深度求索、稀宇五家厂商几乎同时完成了一件事 : 把旗舰模型的能力压进一个更小的激活参数里 , 再用十分之一甚至十二分之一的价格卖出去 ;

  • Qwen3.8-Flash 的价格是 Qwen3.8-Max 的十二分之一 ;
  • GLM-5.3-Flash 的价格约为 GLM-5.3 的十分之一 ;
  • DeepSeek 更激进 , 直接把上一代旗舰挤下线 , 自 2026-09-14 UTC 时间凌晨 4 点起 , 所有 deepseek-v4-pro 请求被官方路由到 deepseek-v4.1-flash , 并按 Flash 价格计费 , 官方 19 项测评中 V4.1-Flash 有 14 项超过 V4-Pro ;

于是选型问题变了 ; 目前不再需要问 " 哪家最强 " , 而是要问 : 我要的这项能力 , 旗舰与蒸馏版之间的差距 , 值不值那十倍的价钱 ? 本文用九款模型、八个维度、四组旗舰与蒸馏的对位关系 , 把这个问题拆开讲清楚 ;

数据截至 2026-09-14 , 交叉验证自 SuperCLUE、Artificial Analysis、LLM Stats、LMArena 四个独立来源 , 并补充腾讯云 TokenHub、火山方舟、千问 AI 平台、百度千帆四家的 Token Plan 真实折合单价 ;





一、大模型评分标准



1、四组旗舰与蒸馏模型


本次只 对比 " 旗舰模型 + 该厂对应的蒸馏 ( Flash / 轻量 ) 版本 " , 共四组对位关系 , 外加一款 没有蒸馏版参评的独立选手 ;

  • 阿里通义 : 旗舰 Qwen3.8-Max ( 2026-08-02 ) , 蒸馏版 Qwen3.8-Flash ( 2026-08-26 ) ;

  • 腾讯混元 : 旗舰 Hy4 preview ( 2026-08-28 ) , 上一代轻量 Hy3 ( 2026-07-06 ) ;

  • 智谱 GLM : 旗舰 GLM-5.3 ( 2026-08-14 ) , 蒸馏版 GLM-5.3-Flash ( 2026-08-26 ) ;

  • 深度求索 : 上一代旗舰 DeepSeek-V4-Pro ( 2026-08-12 ) , 新一代蒸馏 DeepSeek-V4.1-Flash ( 2026-09-10 ) , 并且 DeepSeek-V4.1-Flash 性能 > DeepSeek-V4-Pro ;

  • 稀宇 MiniMax : MiniMax-M3 ( 2026-06-01 ) , 本次无对应蒸馏版参评 ;

需要特别标注的是 DeepSeek 这一组的特殊性 ; DeepSeek-V4-Pro 已经实质退役 , 官方把它路由到 V4.1-Flash 并按低价计费 , 官方 Harness 负责人公开表态 " 以更高价格提供表现更差的模型不合适 " ;

因此本文里 V4-Pro 的名次 , 反映的是上一代旗舰的历史位置 , 不是你现在能买到的服务 ; 选型时请把 V4-Pro 当作 " 对照组 " , 把 V4.1-Flash 当作 " 可选项 " ;


2、评分标准与规则


在看排名之前 , 先明确四条规则 , 否则后面所有数字都会被误读 ;

  • 规则一 , 排名是档位不是分数差 : 九款模型挤在 40 到 45 分的 Artificial Analysis 区间里 , 0.05 分的差距在四点量表上属于平局 ; 第 1 名与第 2 名往往只是 " 同一档位的两个方向 " , 不是碾压关系 ;

  • 规则二 , 自测与第三方分开看 : Hy4 preview 无任何独立第三方聚合分 , 其全部数字来自腾讯自测 ; Qwen3.8-Flash 全部 benchmark 为阿里自测 ; DeepSeek V4.1-Flash 的领先数据为自测 ; 遇到自测数字 , 默认打七折看 ;

  • 规则三 , Terminal-Bench 2.1 与 3.0 不可跨版比较 : GLM-5.3 的 TB3.0 等于 28.3 , 是更难的长程基准 , 量表不同 , 不能与 TB2.1 的 84 到 90 区间并列阅读 ;

  • 规则四 , 价格统一按混合口径 : 输入比输出按 4 比 1 , 取高峰时段 , 不计缓存命中 ; 这是 Agent 工具的典型负载 , 也是四家平台唯一能拉平的口径 ; 全文价格除特别说明外 , 一律用国内官网 API 按量付费价 , 单位为元每百万 token ;





二、大模型多维对比



1、参数对比


模型厂商总参 / 激活上下文模态许可价格 元/百万 ( 入 / 出 )发布
Qwen3.8-Max阿里2.4T / 95B1M文 + 图 + 视频Qwen3.8-Max License ( 开源版 Apache 2.0 )12 / 362026-08-02
Qwen3.8-Flash阿里125B ( +51B emb ) / 6B262K 到 1M文 + 图 + 视频闭源 ( Flash-Next 开源 )1.0 / 2.82026-08-26
Hy4 preview腾讯770B / 49B1M纯文本Apache 2.0限免 ( 已到期 )2026-08-28
Hy3腾讯295B / 21B256K纯文本Apache 2.00.8 / 3.52026-07-06
MiniMax-M3稀宇428B / 23B1M ( MSA )原生多模态 + 桌面操作Custom ( 署名 )1.8 / 7.22026-06-01
GLM-5.3智谱753B / 约 40B1M纯文本GLM-5.3 License8 / 282026-08-14
GLM-5.3-Flash智谱320B / 18B1M原生多模态 ( 文 + 图 + 视频 )MIT0.8 / 2.82026-08-26
DeepSeek-V4-Pro深度求索1.6 到 1.7T / 49B1M纯文本MIT2.6 / 5.22026-08-12
DeepSeek-V4.1-Flash深度求索552B / 8B 入 · 16B 出1M文 + 图MIT峰谷定价 , 高峰 2 / 8 , 闲时 1 / 42026-09-10

注 : 价格列统一取国内官网 API 按量付费刊例价 , 单位为元每百万 token , 高峰时段 , 按输入 / 输出列出 ; 原美元刊例价按 1 美元约 6 元 折算 , 实际扣费以各家控制台公示为准 ;

这里有一个容易被忽略的架构细节 : DeepSeek-V4.1-Flash 是九款中唯一采用 Causal Encoder-Decoder ( CED ) 非对称架构的模型 , 40 层拆成 20 层因果编码器加 20 层解码器 , prefill 只跑编码器 ( 8B 激活 ) , decode 才跑全模型 ( 16B ) ; 结果是 KV cache 从 3514 字节每 token 压到 890 字节每 token , HBM 需求降到四分之一 , SSD 需求降到八分之一 ; 这是它成本效率能排第一的结构性原因 , 不是调价调出来的 ;


2、旗舰与蒸馏的压缩比


把四组对位关系放在一起看 , 压缩幅度惊人地一致 ;

  • 阿里组 : 激活参数从 95B 压到 6B , 约十六分之一 ; 价格从 12 / 36 压到 1.0 / 2.8 , 约十二分之一 ;

  • 智谱组 : 激活参数从约 40B 压到 18B , 约二分之一 ; 价格从 8 / 28 压到 0.8 / 2.8 , 约十分之一 ;

  • 腾讯组 : Hy4 preview 到 Hy3 不是同代蒸馏 , 而是跨代轻量 , 激活 49B 到 21B , 上下文 1M 到 256K , 价格 0.8 / 3.5 是九款中最低档之一 ;

  • DeepSeek 组 : V4-Pro 到 V4.1-Flash 激活从 49B 降到 8B 入 / 16B 出 , 价格从 2.6 / 5.2 进入峰谷机制 , 高峰 2 / 8 元 , 闲时 1 / 4 元 ;

  • 能力保留度 : 阿里 Qwen3.8-Flash 与 智谱 GLM-5.3-Flash 两组的 蒸馏版 都保留了原生多模态能力 , 且上下文都守住了 1M , 这是 2026 年蒸馏技术最明显的进步——过去蒸馏必砍上下文和模态 , 现在这两项反而不砍了 ;





三、多维排名



先看一张总表 , 下表是九款模型在六个主维度上的名次 , 数字越小越好 ,

第六列 " 其它维度 " 是成本效率、开放性、多模态、长上下文、速度的综合名次 ;

前五列的名次按两条规则给出 :

  • 第一 , 满血旗舰整体排在蒸馏与轻量版之前 ;
  • 第二 , 同一组内再按 SuperCLUE、Artificial Analysis、LMArena 等实测数据排序 ;

DeepSeek-V4-Pro 已实质退役 , 不再参与排序 ;

模型文字补全推理文字能力思考能力编程能力Agent 执行其它维度
GLM-5.3122116
Qwen3.8-Max211225
Hy4 preview333344
DeepSeek-V4.1-Flash444451
MiniMax-M3555537
GLM-5.3-Flash666662
Qwen3.8-Flash777773
Hy3888888

1、文字能力


排序 : Qwen3.8-Max > GLM-5.3 > Hy4 preview > DeepSeek-V4.1-Flash > DeepSeek-V4-Pro > MiniMax-M3 > GLM-5.3-Flash > Qwen3.8-Flash > Hy3 ;

排名依据 :

  • Qwen3.8-Max : SuperCLUE 总分第一 , 精确指令遵循 43.81 为九款最高 , 幻觉控制 86.08 到 86.19 , LMArena 中文榜 ELO 1538 加减 18 , 全球第 12、国产第一 ;

  • GLM-5.3 : 综合智能最强带动文字表达 , 中文总榜 71.29 , 仅次于 Qwen 系 ;

  • DeepSeek-V4.1-Flash : 幻觉控制 87.16 , 数学推理 84.21 , 两项均为全场第一 , SuperCLUE 71.81 是开源阵营第一 , 是蒸馏版里文字能力最强的一款 ; 按满血旗舰优先的口径 , 名次整体压在四款旗舰之后 ;

  • DeepSeek-V4-Pro : 0813 版幻觉控制 89.73 为九款最高 , 但总榜只有 70.10 , 被自家 Flash 反超 ; 本次按旗舰组排第 4 , 反映的只是上一代旗舰的历史位置 ;

  • Hy4 preview : 缺少 SuperCLUE 数据 , LMArena WebDev 数据分析分榜 ELO 1561 第一 , 但投票数仅 261、置信区间加减 37 , 样本不足 , 只能作参考 ;

  • MiniMax-M3 : 指令遵循 20.00、幻觉控制 70.44 , 两项均为九款最低 , 这是它在文字类任务上的硬伤 ; 名次之所以仍排在四款蒸馏与上代轻量之前 , 靠的是满血旗舰的长上下文与原生多模态底子 , 不是文字质量 ;

结论 : 中文写作、公文、对外文案这类任务 , 第一选择是 Qwen3.8-Max , 第二选择是 GLM-5.3 ; 预算敏感时 , DeepSeek-V4.1-Flash 是蒸馏版里文字最强的一档 ; MiniMax-M3 与 DeepSeek-V4-Pro 都不建议用于需要严格遵循指令的文字任务 ;


2、思考推理能力


排序 : Qwen3.8-Max > GLM-5.3 > Hy4 preview > DeepSeek-V4.1-Flash > DeepSeek-V4-Pro > MiniMax-M3 > GLM-5.3-Flash > Qwen3.8-Flash > Hy3 ;

排名依据 :

  • Qwen3.8-Max : GPQA Diamond 92.6 , PaperBench 93.0 , 最大思维链长度 262K , SuperCLUE 科学推理 71.93 , 长链思考的物理上限最高 ;

  • GLM-5.3 : Terminal-Bench 3.0 得分 28.3 , 而 GLM-5.2 只有 4.6 , 长程推理跃升幅度是九款中最大的 ; CyberGym 84.5 ;

  • Hy4 preview : GPQA 92.3 , 思考深度够 , 但官方自陈两个失败模式 , 一是在复杂任务上推理耗时过长 , 二是倾向于过度验证自己的工作 , 深度够而效率差 ;

  • DeepSeek-V4.1-Flash : SuperCLUE 数学推理 84.21 全场第一 , 但 GPQA 与长链推理数据披露不足 , 且属蒸馏版 , 长链思考的名次整体压在四款满血旗舰之后 ;

  • MiniMax-M3 : M3 MaxProof 生成式验证强化学习驱动的数学证明系统是唯一亮点 , 但 SuperCLUE 数学仅 70.18 , 整体垫底 ;

结论 : 需要 " 把一件事想透 " 的任务 , 第一选择 Qwen3.8-Max , 第二选择 GLM-5.3 ; 若任务可被拆解成明确的数学步骤 , DeepSeek-V4.1-Flash 的性价比更高 ;


3、数学与科学能力


这一维度要把数学与科学拆开看 , 否则会得出矛盾的结论 ;

数学单科排序 : GLM-5.3 > Qwen3.8-Max > Hy4 preview > DeepSeek-V4.1-Flash > DeepSeek-V4-Pro > MiniMax-M3 > GLM-5.3-Flash > Qwen3.8-Flash > Hy3 ;

科学单科排序 : Qwen3.8-Max > GLM-5.3 > Hy4 preview > DeepSeek-V4.1-Flash > DeepSeek-V4-Pro > MiniMax-M3 > GLM-5.3-Flash > Qwen3.8-Flash > Hy3 ;

综合排序 : Qwen3.8-Max > GLM-5.3 > Hy4 preview > DeepSeek-V4.1-Flash > DeepSeek-V4-Pro > MiniMax-M3 > GLM-5.3-Flash > Qwen3.8-Flash > Hy3 ;

排名依据 :

  • Qwen3.8-Max : GPQA Diamond 92.6 与 PaperBench 93.0 双高 , 科研复现能力是九款中唯一达到评测新高的 ;

  • GLM-5.3 : SuperCLUE 科学推理 75.44 并列最高 , 同源 GLM-5.2 系列 AIME 99.2、GPQA 91.2 , 竞赛数学底子极硬 ;

  • DeepSeek-V4.1-Flash : SuperCLUE 数学推理 84.21 为全场第一 , 数学单科确实是九款里最硬的一块 ; 但按满血旗舰优先的整体口径 , 名次排在旗舰组之后 , 属于单项冠军而整体让位 ;

  • Hy4 preview : GPQA 92.3 , 与 Qwen 只差 0.3 分 , 属于同一档位 ;

  • MiniMax-M3 : 数学 70.18 , 科学数据缺失 ;

结论 :

  • 竞赛数学与证明类任务 , 第一选择 GLM-5.3 , 第二选择 Qwen3.8-Max ;
  • 若只看数学单科 , DeepSeek-V4.1-Flash 的 84.21 仍是全场最高 , 是性价比最高的数学专项档 ;
  • 科研复现与科学推理 , 第一选择 Qwen3.8-Max , 第二选择 GLM-5.3 ;

4、编程能力


排序 : GLM-5.3 > Qwen3.8-Max > Hy4 preview > DeepSeek-V4.1-Flash > DeepSeek-V4-Pro > MiniMax-M3 > GLM-5.3-Flash > Qwen3.8-Flash > Hy3 ;

模型Terminal-Bench 2.1SWE-bench ProDeepSWE v1.1其它关键数据
DeepSeek-V4.1-Flash90.6未披露74.2CyberGym 88.1
GLM-5.3未披露 ( TB3.0 等于 28.3 )约 63 到 65 ( 独立复测 )66.9SuperCLUE 智能体编程 76.84 第一 ; LLM Stats Coding 43.1 第一
Qwen3.8-Max86.667.7 ( 开源第一 )未披露Code Arena WebDev 1691 , 全球登顶
Hy4 preview85.465.7未披露SWE-bench Multilingual 82.9 ; CodeArena WebDev 全球第 6
DeepSeek-V4-Pro87.955.462.7TB2.1 高但 SWE-Pro 明显偏低
GLM-5.3-Flash84.3未披露63.4Z.ai Code Bench v1.0 等于 29.0 ( Opus 4.8 为 29.5 )
Qwen3.8-Flash未披露62.5 ( Flash-Next )未披露SuperCLUE 智能体编程 61.05
MiniMax-M366.059.0未披露KernelBench Hard 28.8 ; SWE-fficiency 34.8
Hy3未披露未披露未披露CodeArena WebDev 全球第 28 ; SuperCLUE 编程 47.37

排名依据 : DeepSeek-V4.1-Flash 的 Terminal-Bench 2.1 等于 90.6 , 超过 GPT-5.6 Sol 的 88.8、Kimi K3 的 88.3、Claude Opus 5 的 86.7 , 是九款中唯一登顶该榜的模型 , 但这是自测数据且尚无独立复现 ; GLM-5.3 在 SuperCLUE 智能体编程与 LLM Stats Coding 两项第三方指标上都是第一 , 可信度反而更高 ; Qwen3.8-Max 的 Code Arena WebDev 1691 全球登顶 , 前端与网页生成是它的绝对强项 ; 本次按满血旗舰优先排序 , DeepSeek-V4.1-Flash 的 TB2.1 榜首只让它拿到蒸馏组第一 , 但纯终端闭环场景它仍是最划算的一档 ;

结论 : 终端 Agent 与工程闭环 , 第一选择 GLM-5.3 , 第二选择 DeepSeek-V4.1-Flash ( TB2.1 榜首 , 且价格只有前者的四分之一 ) ; 前端与网页生成 , 第一选择 Qwen3.8-Max , 第二选择 Hy4 preview ;


5、自主 Agent 执行能力


排序 : GLM-5.3 > Qwen3.8-Max > MiniMax-M3 > Hy4 preview > DeepSeek-V4.1-Flash > DeepSeek-V4-Pro > GLM-5.3-Flash > Qwen3.8-Flash > Hy3 ;

排名依据 :

  • GLM-5.3 : SuperCLUE 智能体任务规划 91.15 全场第一 , Agents’ Last Exam ( CLI ) 28.5 , ExploitBench 54.4 , 三个独立指数全部第一 ;

  • DeepSeek-V4.1-Flash : Automation-Bench 54.8 全场第一 ( V4-Pro 为 43.2 , GLM-5.3-Flash 为 48.8 ) , DeepSWE 74.2 , 官方称在 DeepSWE v1.1、CyberGym、Automation-Bench 三项超过 Kimi K3、GLM-5.3、Opus 5、GPT-5.6 Sol ;

  • Qwen3.8-Max : OSWorld-Verified 86.1 , AA Agentic Index 55.4 全球第一 , SuperCLUE 任务规划 90.94 , 长程电脑操作是它最不可替代的能力 ;

  • GLM-5.3-Flash : Toolathlon Verified 78.4 , OSWorld 2.0 等于 59.1 , GDPval-AA v2 Elo 1773 ( Opus 4.8 为 1582 ) , 这是全表唯一由 Artificial Analysis 而非智谱自测的数字 , 含金量最高 ;

  • Hy4 preview : 原生 Agent 长程规划与工具调用优化 , Toolathlon Verified 74.1 , 在 APEX-Agents、MCP Atlas、SkillsBench、Toolathlon、WideSearch 上全面胜过 Hy3 ;

  • MiniMax-M3 : BrowseComp 83.5、MCP Atlas 74.2、OSWorld-verified 76.2 , 且具备原生桌面操作能力 , 硬指标数量在旗舰组里仅次于 GLM-5.3 与 Qwen3.8-Max , 名次因此升到本维度第 3 ; 但第三方评估认为其 coding 与 agent 整体仍明显落后 GLM 与 Kimi ;

  • Hy3 : SuperCLUE 任务规划 66.82 , 仅具备基础多轮推理与主流工具调用 ;

需要泼一盆冷水 : Automation-Bench 54.8 意味着约一半的复杂工作流仍然会失败 ; 当前所有模型的自主 Agent 能力 , 都还处在 " 需要人工兜底 " 的阶段 , 不要把 Agent 直接接到不可逆的生产动作上 ;

结论 :

  • 长程规划与流程自动化 , 第一选择 GLM-5.3 , 第二选择 Qwen3.8-Max ;
  • 电脑操作与 GUI 自动化 , 第一选择 Qwen3.8-Max , 第二选择 MiniMax-M3 ( 唯一原生桌面操作 ) ;
  • 预算受限时 , DeepSeek-V4.1-Flash 的 Automation-Bench 54.8 仍是全场最高的单项 ;

6、成本效率


排序 : DeepSeek-V4.1-Flash > GLM-5.3-Flash > Qwen3.8-Flash > DeepSeek-V4-Pro > Hy4 preview > Qwen3.8-Max > GLM-5.3 > MiniMax-M3 > Hy3 ;

先按原厂 API 刊例价看 ( 元每百万 token , 输入 / 输出 ) : Qwen3.8-Flash 为 1.0 / 2.8 , GLM-5.3-Flash 为 0.8 / 2.8 , Hy3 为 0.8 / 3.5 , MiniMax-M3 为 1.8 / 7.2 , DeepSeek-V4-Pro 为 2.6 / 5.2 , DeepSeek-V4.1-Flash 走峰谷定价 ( 高峰 2 / 8 元 , 闲时 1 / 4 元 ) , GLM-5.3 为 8 / 28 , Qwen3.8-Max 为 12 / 36 ;

再看四家 Token Plan 订阅包的真实折合单价 ( 元每百万混合 token , 输入比输出 4 比 1 , 高峰 , 常规价 ) :

模型腾讯 TokenHub火山方舟原价千问 Pro 档 ( 推算 )千帆积分制 Max千帆 Token 制 Max原厂 API 混合价
GLM-5.312.000.903.002.180.8612.00
GLM-5.3-Flash1.200.100.300.220.860.60
DeepSeek-V4.1-Flash3.200.500.810.210.863.20
DeepSeek-V4-Pro13.201.103.102.290.8612.60
Hy31.60不接入不接入不接入不接入不接入
Hy4 preview8.40不接入不接入不接入不接入不接入
Qwen3.8-Max不接入不接入4.13不接入不接入16.80
Qwen3.8-Flash不接入不接入0.29不接入不接入2.32

排名依据 :

  • DeepSeek-V4.1-Flash : MIT 许可加 1M 上下文加原生图像输入 , KV cache 省四倍 HBM , 峰谷定价闲时缓存命中低至 0.02 元每百万 token ; Agent 场景下缓存命中占成本大头 , 这是结构性优势而非价格战 ;

  • GLM-5.3-Flash : MIT 加 1M 加原生多模态 , 0.8 / 2.8 元 , 比 MiniMax-M3 输入便宜 2.25 倍 , 输出便宜 2.6 倍 ; 混合稀疏加线性注意力让 KV cache 比 GLM-5.3 小 4.4 倍 , Unsloth 3-bit GGUF 可在 256GB Mac Studio 上跑 ;

  • Qwen3.8-Flash : 1.0 / 2.8 元 , 约为 Qwen3.8-Max 的十二分之一 , 6B 激活实现接近轻量模型的速度 ;

  • Qwen3.8-Max 与 GLM-5.3 靠后 : 前者贵且慢 ( 21 到 48 token 每秒 ) , 后者纯文本 , 8 / 28 元 , 且 Artificial Analysis 标记其 token 消耗异常高 , 指数评测耗 1.7 亿输出 token , 中位数为 1.1 亿 ;

  • Hy3 垫底 : 256K 上下文是九款最短 , 且纯文本 , 唯一优势是限免至 2026-09-30 ;

结论 : 高并发跑量与成本敏感场景 ,

  • 第一选择 GLM-5.3-Flash ( 火山方舟通道 0.10 元每百万 ) ,
  • 第二选择 DeepSeek-V4.1-Flash ( 千帆积分制 0.21 元每百万 ) ;

若走千帆 Token 制 1 比 1 不分模型 , 旗舰模型也能压到 0.86 元每百万 ;


7、多模态理解能力


排序 : Qwen3.8-Max > MiniMax-M3 > GLM-5.3-Flash > Qwen3.8-Flash > DeepSeek-V4.1-Flash > 其余四款纯文本模型 ( Hy4 preview , Hy3 , GLM-5.3 , DeepSeek-V4-Pro ) ;

排名依据 :

  • Qwen3.8-Max : Vision Arena 全球第 2 , BabyVision 82.0 ( 无工具 ) , 文加图加视频三模态输入 , 图表与截图理解最强 ;

  • MiniMax-M3 : Step 0 原生混合训练 , 100T interleaved 数据 , 原生多模态加桌面操作 , 是唯一能 " 看懂屏幕并操作它 " 的开放权重模型 ;

  • GLM-5.3-Flash : CharXiv-R 89.4 , OfficeQA Pro 62.4 领先 Opus 4.8 , 文档与图表类理解实测最强 ;

  • Qwen3.8-Flash : 保留了旗舰的文加图加视频模态 , 是蒸馏版里少见的 " 模态不缩水 " 案例 ;

  • DeepSeek-V4.1-Flash : Chartography 78.9 , 但 ZeroBench 仅 49 , 图文能力弱于前四款 ;

  • 四款纯文本模型 : Hy4 preview、Hy3、GLM-5.3、DeepSeek-V4-Pro 均不支持图像输入 , 涉及截图、图表、扫描件的任务直接出局 ;

结论 : 图表与截图理解 ,

  • 第一选择 Qwen3.8-Max ,
  • 第二选择 GLM-5.3-Flash ;

需要桌面操作的多模态任务 , 第一选择 MiniMax-M3 , 第二选择 Qwen3.8-Max ;


8、日常办公


日常办公是复合维度 , 需要同时看文字、多模态、成本、上下文四项 ; 因此给出两条排序 ;

质量优先排序 : Qwen3.8-Max > GLM-5.3 > Hy4 preview > MiniMax-M3 > DeepSeek-V4.1-Flash > DeepSeek-V4-Pro > GLM-5.3-Flash > Qwen3.8-Flash > Hy3 ;

成本优先排序 : GLM-5.3-Flash > Qwen3.8-Flash > DeepSeek-V4.1-Flash > Hy3 > MiniMax-M3 > Hy4 preview > GLM-5.3 > Qwen3.8-Max > DeepSeek-V4-Pro ;


排名依据 :

  • Qwen3.8-Max 登顶 : 文字第 1、指令遵循 43.81 全表最高、Vision Arena 全球第 2、文加图加视频三模态加 1M 上下文 ; 质量口径下成本只占小权重 , 12 / 36 元的劣势被摊薄 ;
  • GLM-5.3 第二 : 文字第 2、1M 上下文 , 但纯文本 , 遇到截图和图表要外挂 OCR ;
  • Hy4 preview 第三 : 文字第 3 , 跨文档、表格、演示文稿是设计目标 , 办公适配度最高 , 代价是纯文本、无 SuperCLUE 与第三方验证、限免已到期 ;
  • MiniMax-M3 第四 : 多模态第 2 是加分 , 但指令遵循 20.00、幻觉控制 70.44 双项垫底 , " 按格式输出一份周报 " 这件事它最不稳 , 办公场景扣分最重 ; 桌面操作是窄场景 , 不构成通用加分 ;
  • DeepSeek-V4.1-Flash 第五 : 蒸馏版本 把上一代旗舰挤下线 , 自 2026-09-14 UTC 时间凌晨 4 点起 , 所有 deepseek-v4-pro 请求被官方路由到 deepseek-v4.1-flash , 并按 Flash 价格计费 , 官方 19 项测评中 V4.1-Flash 有 14 项超过 V4-Pro ;
  • GLM-5.3-Flash : 它是全表办公实测证据最强的一款 , GDPval-AA v2 Elo 1773、OfficeQA Pro 62.4、CharXiv-R 89.4 , 原生多模态加 1M 加 MIT ; 排第六不是能力不足 , 而是质量口径不计成本优势 + 旗舰优先规则叠加的结果 ; 一旦计入成本 , 它立刻回到双料第一。

结论 : 日常办公第一选择 GLM-5.3-Flash , 第二选择 Qwen3.8-Max ; 若预算极紧且任务高度模板化 , 用 Qwen3.8-Flash 或 Hy3 兜底 ;





四、场景选型



1、场景决策


场景第一选择第二选择决策依据
中文写作、公文、对外文案Qwen3.8-MaxDeepSeek-V4.1-Flash指令遵循 43.81 最高 , LMArena 中文榜 1538
需要 " 想透 " 的复杂推理Qwen3.8-MaxGLM-5.3GPQA 92.6 , PaperBench 93.0 , 思维链上限 262K
竞赛数学与定理证明GLM-5.3Qwen3.8-MaxSuperCLUE 数学 84.21 全场第一 , AIME 99.2 系
科研复现与科学推理Qwen3.8-MaxGLM-5.3PaperBench 93.0 , 科学推理 75.44
终端 Agent 与工程闭环GLM-5.3DeepSeek-V4.1-FlashTerminal-Bench 2.1 等于 90.6 , DeepSWE 74.2
前端与网页生成KIMI-K3Qwen3.8-MaxCode Arena WebDev 1691 全球登顶
长程流程自动化GLM-5.3Qwen3.8-Max任务规划 91.15 , Automation-Bench 54.8
电脑操作与 GUI 自动化Qwen3.8-MaxMiniMax-M3OSWorld-Verified 86.1 , AA Agentic Index 55.4
图表、截图、扫描件理解Qwen3.8-MaxGLM-5.3-FlashVision Arena 全球第 2 , CharXiv-R 89.4
日常办公与文档处理GLM-5.3-FlashQwen3.8-MaxGDPval-AA v2 Elo 1773 , 原生多模态
高并发跑量与成本敏感GLM-5.3-FlashQwen3.8-Flash0.8 / 2.8 元 , 火山通道 0.10 元每百万
私有化部署与开源可控GLM-5.3-Flash ( MIT )Hy4 preview ( Apache 2.0 )320B / 18B , 256GB Mac Studio 可跑
超长上下文批处理GLM-5.3DeepSeek-V4.1-Flash均为 1M , 后者 KV cache 省四倍 HBM
需要原生桌面操作MiniMax-M3Qwen3.8-Max唯一开放权重的原生桌面操作模型

2、团队选型


  • 个人开发者 :
    • 主力 : GLM-5.3-Flash , MIT 许可、原生多模态、价格 0.8 / 2.8 元 , 覆盖八成日常需求 ;
    • 备用 : DeepSeek-V4.1-Flash , 遇到终端 Agent 与数学类硬题再切换 ;
    • 不要 : 一上来就买 Qwen3.8-Max 的 Token Plan , 混合价 16.80 元每百万 , 个人用量撑不起这个单价 ;
  • 创业小团队做 AI 产品 :
    • 主力 : GLM-5.3-Flash 走火山方舟通道 ( 0.10 元每百万 ) , 成本可控 ;
    • 质量档 : 对外交付的关键输出用 Qwen3.8-Max 复核一遍 ;
    • 工程档 : 编码 Agent 用 DeepSeek-V4.1-Flash , Terminal-Bench 榜首且 MIT ;
  • 中大型企业的办公自动化 :
    • 主力 : GLM-5.3-Flash , GDPval-AA v2 1773 是真实办公任务的最高分 ;
    • 长文档 : Qwen3.8-Max 或 GLM-5.3 走 1M 上下文 ;
    • 私有化 : Hy4 preview 或 Hy3 走 Apache 2.0 , 许可最干净 ;
  • 科研与算法团队 :
    • 主力 : Qwen3.8-Max , PaperBench 93.0 与 GPQA 92.6 双高 ;
    • 数学 : DeepSeek-V4.1-Flash , 数学推理 84.21 第一且便宜 ;
    • 自部署 : GLM-5.3-Flash ( MIT ) 或 DeepSeek 系 ( MIT ) , 便于改结构与做实验 ;




五、落地实施



1、路由 : 按不确定性分档路由


选型的核心不是 " 哪个模型评分高 " , 而是三问定档法 :

  • 第一问 , 确定性检验 : 你能不能提前描述出正确答案长什么样 , 能写出验收标准的 , 走执行路线用便宜的 Flash 级模型 ; 你自己也不知道好答案是什么的 , 走探索路线用旗舰长思考模型 ;

  • 第二问 , 错误成本检验 : 错了会怎样 ? 低风险 ( 草稿、摘要、去重 ) 保持最低档不要升 ; 中风险 ( 提交到分支的代码、内部报告 ) 用轻量模型加规则化校验兜底 , 比如正则、单测、JSON Schema、编译器 ; 高风险 ( 发布上线、合同、对外文案、付款 ) 升一档 , 并加双模型交叉验证与人工终审 ;

  • 第三问 , 不确定性定价 : 高错误成本不等于一定要用贵模型 ; 让模型输出 JSON 然后入库 , 正确解法是 " 便宜模型加 JSON Schema 强校验 " , 而不是 " 旗舰模型裸奔祈祷它格式对 " ;


2、缓存 : 缓存与峰谷的成本控制


Agent 场景下缓存命中占成本大头 , 这一项做不好 , 模型选得再便宜也白搭 ;

  • 系统提示词固定化 : 把系统提示、工具定义、业务规则放在请求最前面且逐字不变 , 让 prefix cache 稳定命中 ;

  • 工具描述排序固定 : 工具列表的顺序变化会让整个前缀缓存失效 , 这是最常见的隐性成本杀手 ;

  • 多轮会话只追加 : 不要重排历史消息 , 只追加新消息 ;

  • 峰谷错峰 : DeepSeek-V4.1-Flash 闲时 1 / 4 元 , 把批处理、回归测试、数据清洗这类非实时任务排到闲时 ;

  • 缓存成本核算 : 用下面的公式先算一遍再选模型 , 别只看刊例价 ;


3、回归 : 自建回归集


榜单是别人的分布 , 你的业务是自己的分布 ; 上线前必须做三件事 ;

  • 构造 20 到 50 条标注样例 : 从真实业务里抽 , 覆盖高频场景与已知易错场景 ;

  • 双模型 AB 对照 : 同一批样例跑两遍 , 比较的不只是准确率 , 还有 token 消耗与耗时 ;

  • 固化成回归集 : 每次模型升级或价格调整都跑一遍 , 保留历史曲线 , 避免 " 换了模型效果悄悄变差 " ;





六、注意事项与避坑



1、榜单数据


  • Artificial Analysis 存在两套口径 : v4.1.1 快照 ( 2026-09-02 ) 给 GLM-5.3 59.5、Qwen3.8-Max Preview 58.1 , 而 Top50 日榜 ( 2026-09-13 ) 给 GLM-5.3 45、Qwen3.8-Max 40 ; 两者相对位次一致 , 但绝对值不可混用 , 引用时必须标注日期与版本 ;

  • LMArena 是主观偏好投票不是能力测试 : 分榜相互独立 , 分差在误差范围内应视为并列 ; Hy4 preview 的分榜投票数仅 261、方差 20 , 官方自己也标注为 " 不稳 " ;

  • Terminal-Bench 2.1 与 3.0 不可跨版比较 : GLM-5.3 的 TB3.0 等于 28.3 与 TB2.1 的 84 到 90 区间不是同一把尺子 , 混着看会严重低估 GLM-5.3 ;

  • 腾讯的盲测不能证明 " 更强 " : 163 专家 203 任务盲测中 Hy4 preview 2.99、Kimi K3 2.94、GLM-5.3 2.92 , 0.05 分的差距在四点量表上属于平局 , 只能证明 " 同一档位 " ;


2、蒸馏版


  • 不要假设蒸馏版是旗舰的缩小版 : GLM-5.3-Flash 是多模态、GLM-5.3 是纯文本 ; Qwen3.8-Flash 在 Agent 执行上排第 8 , 而 Qwen3.8-Max 排第 2 ; 蒸馏会改变能力结构 , 不是等比缩放 ;

  • 深度推理类任务会明显掉档 : Qwen3.8-Flash 在思考能力上排第 8 , 与旗舰的第 1 差距巨大 , 长链推理不要指望 Flash 版 ;

  • 许可要单独核对 : Qwen3.8-Flash 闭源 , 开源权重版名为 Qwen3.8-Flash-Next , 许可是 qwen-community-1.0 而非 Apache-2.0 ; GLM-5.3 是自定义 License 且有营收门槛 ; GLM-5.3-Flash 与 DeepSeek 双雄才是干净的 MIT ; Hy4 preview 与 Hy3 是 Apache 2.0 ;

  • 自测数据默认打七折 : Qwen3.8-Flash 发布仅数周无外部复现 , DeepSeek V4.1-Flash 的领先数据同样为自测 ;


3、价格与套餐


  • 促销价都会到期 : 火山 Small 与 Medium 首两月 2.5 折至 2026-11-08 , 第三个月起恢复原价 , 单位成本上涨约 4 倍 ; 千帆首购秒杀、千问早鸟价、腾讯 9 月限时折扣同理 ; 长期成本一律按常规价核算 ;

  • 买大档不会更便宜 : 火山方舟定价严格线性 , 原价口径下四档均为 0.002 元每 AFP , 无规模折扣 , 买大档只是买到更多额度 ;

  • 腾讯 Token Plan 无价格优势 : 积分价约等于原厂 API 刊例价 , GLM-5.3 混合价 12.00 与原厂 12.00 持平 , 买的是统一计量与接入便利 , 不是折扣 ;

  • 千帆 Token 制是隐藏最优解 : 1 比 1 不分模型 , Max 档任意旗舰模型 0.86 元每百万 ( 首购 0.43 ) , GLM-5.3 成本仅为积分制的 40% ; 跑旗舰选 Token 制 , 跑 Flash 选积分制 ;

  • 千问平台无法精确比价 : 官方明确不公开每模型的 Credits 与 Token 比率 , 所有折合数字都是推算 , 中低置信 , 以控制台实际扣减为准 ;



总结


把九款模型、八个维度、四组对位关系全部摊开之后 , 结论其实很朴素 ;

第一 , 旗舰与蒸馏的裂缝 , 在不同维度上宽度完全不同 ; 成本效率维度几乎不存在裂缝——GLM-5.3-Flash 的综合表现甚至好过旗舰 GLM-5.3 ; 多模态维度裂缝也很小 , 蒸馏版普遍不砍模态与上下文 ; 但思考推理与自主 Agent 维度裂缝极宽 , Qwen3.8-Flash 的思考能力排第 8 , Qwen3.8-Max 排第 1 , 这不是调参能补的差距 ;

第二 , 2026 年最值得买的不是最贵的 , 也不是最便宜的 , 而是 " 能力结构与任务结构匹配 " 的那一款 ; GLM-5.3-Flash 以 0.8 / 2.8 元每百万的价格拿到 GDPval-AA v2 的 1773 分 , 是本次对比中唯一在质量与成本两个排序里都进前三的模型 ;

第三 , DeepSeek-V4-Pro 的退役是一个信号 ; 当蒸馏版在官方 19 项测评里有 14 项超过上一代旗舰时 , " 旗舰 " 这个概念本身就在被重新定义 ; 你买的从来不是 " 智能 " , 而是 " 不确定性 " ——当你已经知道答案长什么样 , 用最便宜的蒸馏版 ; 当你不知道答案是什么 , 才需要为旗舰的长思考付费 ;

如果只记三句话 : 日常办公与跑量选 GLM-5.3-Flash ; 中文写作与科研复现选 Qwen3.8-Max ; 编码 Agent 与 数学选 GLM-5.3-Flash ; 剩下的 , 交给自建回归集去验证 ;

在这里插入图片描述

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐