Kimi K3 2.8万亿参数登顶全球代码榜——MoE第四极来了

点点词元技术专栏 · 第37期

上一篇(第36期)我们横评了国产开源MoE三强:Qwen 3.7 Max、Kimi K2.7 Code、DeepSeek V4 Pro。当时Kimi K2系列还停在1T参数级别。不到一个月,月之暗面直接甩出了K3——2.8万亿参数、Arena前端代码榜全球第一、完整权重即将开源。国产MoE的第四极,来了。


一、开场:1679分,国产模型首次登顶Frontend Code Arena

2026年7月17日凌晨,月之暗面(Moonshot AI)在WAIC 2026世界人工智能大会前夕正式发布新一代旗舰模型Kimi K3。发布不到24小时,一组数据引爆了整个开发者社区:

排名 模型 Arena AI Code Arena 得分
🥇 第1名 Kimi K3 1679
第2名 Claude Fable 5 1631
第3名 GPT-5.6 Sol (xHigh) 1618
第4名 GLM-5.2 1587
第5名 Claude Opus 4.8 1562

这不是月之暗面自己出题、自己打分的内部评测。Arena AI的Frontend Code Arena采用匿名双盲对战投票机制——同一道任务交给两个匿名模型,全球用户在真实体验两个结果后投票,投票结束才揭晓模型身份。品牌影响被完全剥离,结果更具含金量。

Kimi K3在七个前端细分领域中拿下六个第一:品牌营销、参考图还原、数据分析、消费产品、模拟仿真、内容创作工具。仅在游戏领域小幅落后Fable 5,排名第二。

从Kimi K2.6的第18名直接跳到第1名——17个名次的跃升,累计获得约48万次投票支持。

马斯克本人也在评论区留言:Impressive(令人印象深刻)。

Arena AI联合创始人兼CEO更是称其为可能是今年最重大的发布,认为它动摇了OpenAI、Anthropic等美国闭源模型的主导地位。彭博社报道将此事件比作新的DeepSeek时刻。

但Arena只是冰山一角。让我们把K3的核心参数表拉出来,逐项拆解。


二、核心规格:2.8万亿参数的"开源巨兽"

2.1 参数卡片

属性 数值
总参数 2.8万亿(2.8T)
架构 MoE(Stable LatentMoE)
专家配置 896个专家,每次推理激活16个
上下文窗口 100万token(1,048,576)
最大输出 默认131,072,最高可达1,048,576
多模态 原生支持图像+视频输入,文本输出
注意力机制 KDA(Kimi Delta Attention)混合线性注意力
深层信息传递 AttnRes(Attention Residuals)注意力残差
推理模式 始终开启思考(thinking always-on)
量化训练 MXFP4权重 + MXFP8激活(量化感知训练)
开源状态 完整权重2026年7月27日发布
许可证 Modified MIT
推荐部署配置 supernode,≥64个加速器

2.8万亿是什么概念?在K3之前,开源模型的参数上限由DeepSeek V4的1.6T保持。K3直接把这个上限抬到了近两倍——开源阵营首次具备了与闭源旗舰在"规模天花板"上正面竞争的能力

但参数大不等于能力强。关键在于:这2.8万亿参数是怎么被"驯服"的。

2.2 架构拆解:两把钥匙驯服2.8T

K3的架构基于两项自研核心技术,分别解决两个维度的问题:

问题一:100万token的上下文太长,传统Attention算不动

当上下文窗口拉到100万token时,标准自注意力(Self-Attention)的计算量按序列长度的平方增长。每生成一个新token,都要重新对所有历史token做注意力计算——这在百万级上下文下是不可承受之重。

解法:Kimi Delta Attention(KDA)混合线性注意力

KDA的核心思路是将长上下文拆解为"已总结的历史"和"新来的变化(Delta)"。对历史部分用线性方式维护一个紧凑的记忆状态,新token只需要重点关注变化部分,而不是重新计算全量注意力。

通俗类比:想象你在读一本100万字的小说。传统方法要求你每读一页都重新翻回第一页确认上下文;KDA的做法是维护一个不断更新的"故事摘要",你只需要关注新页和摘要之间的差异。

官方数据:在百万token上下文场景下,KDA将解码速度最高提升了6.3倍

问题二:模型太深,信息在层层传递中衰减

2.8T参数的MoE模型,网络深度远超常规模型。早期层学到的有用特征,在逐层传递过程中容易被后面层的信息淹没——这就是深度学习经典的"信息衰减"问题。

解法:Attention Residuals(AttnRes)注意力残差

AttnRes的核心思路是让后面的网络层能够根据当前输入,从前面不同层中选择性地检索和汇集有用信息,而不是简单地将所有前层信息逐层累积。

一个值得关注的细节:这项技术的核心贡献者之一,是17岁的深圳高中生陈广宇。他与月之暗面研究员张宇、苏剑林在AttnRes论文中被标注为同等贡献者。据苏剑林回忆,陈广宇和张宇共同提出了Block AttnRes(分块注意力残差),将逐层选择改为分块选择,在保留大部分效果的同时降低了显存占用和通信开销。

官方披露的数据极为亮眼:AttnRes增加的额外成本不到2%,却带来约25%的训练效率提升。对于参数规模以万亿计的大模型,这意味着极小的代价换来了显著的收益。

加上MoE层面的优化:

  • Stable LatentMoE框架:896个专家中每次激活16个,保持极高稀疏度
  • Quantile Balancing:替代启发式的专家均衡策略,确保训练稳定
  • Per-Head Muon:让注意力头独立优化
  • Sigmoid Tanh Unit(SiTU)+ Gated MLA:分别改善激活控制和注意力选择性

这些技术叠加在一起,让K3相较上一代K2实现了约2.5倍的整体扩展效率提升——同样的算力投入,能转化出更强的能力。

2.3 两个变体:K3 Max 与 K3 Swarm Max

K3发布时提供两个变体:

  • K3 Max:面向对话与智能体(Agent)任务,适合需要深度推理、长程编程的场景
  • K3 Swarm Max:面向大规模并行处理,适合多Agent协同、高并发任务调度

API调用的模型名统一为kimi-k3,两个变体通过参数和路由策略区分。


三、Benchmark全维度拆解:不是全面登顶,而是"多点开花"

3.1 编码能力:编程赛道正面硬刚闭源旗舰

月之暗面明确表示,K3是公司迄今编程能力最强的模型。所有分数均在reasoning_effort: maxtemperature: 1.0top_p: 1.0条件下获得。

基准测试 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GPT-5.5 GLM-5.2 K3排名
SWE Marathon(极限编码) 42.0 35.0 39.0 40.0 14.0 13.0 🥇第一
ProgramBench(端到端完成度) 77.8 76.8 77.6 71.9 70.8 63.7 🥇第一
Terminal-Bench 2.1 88.3 84.6 88.8 84.6 83.4 82.7 第二(差0.5)
FrontierSWE(高难度SE) 81.2 86.6 71.3 66.7 64.9 67.3 第二
DeepSWE 67.5 70.0 73.0 59.0 67.0 46.2 第三
ArenaAI CodeArena 1679 1631 1618 🥇第一
Kimi Code Bench 2.0 72.9 76.9 第二

解读要点:

  1. SWE Marathon是最大亮点。这个基准测试衡量的是模型在数小时甚至数十小时的持续工程任务中的表现,K3以42.0分登顶,而GPT-5.5和GLM-5.2直接掉到了13-14分的低区间——说明K3在"长程编码马拉松"中的持久力远超同行。

  2. ProgramBench以77.8分微弱领先。说明K3在端到端编程完成度上已达到最顶尖水平。

  3. Terminal-Bench 2.1只差0.5分。与GPT-5.6 Sol的88.8几乎持平。

  4. FrontierSWE和DeepSWE仍有差距。在需要创造性解决复杂系统问题的场景中,Fable 5依然是天花板。K3的FrontierSWE(81.2)超过GPT-5.6 Sol(71.3),但距Fable 5(86.6)还有5分差距。

3.2 Agent智能体能力:全面超越Opus 4.8

基准测试 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
BrowseComp(网页深度调研) 91.2 88.0 90.4 84.3
SpreadsheetBench 2(Excel建模) 34.8 34.7 32.4 31.6 28.1
Automation Bench(自动化任务) 30.8 29.1 29.7 27.2 12.9
DeepSearchQA(F1) 95.0 94.2 93.1
AA-Briefcase(Elo) 1,548 1,583 1,495 1,354 1,260
GDPval-AA v2(Elo) 1,668 1,760 1,748 1,600 1,514
Job Bench 52.9 57.4 46.5 48.4 43.4

K3在BrowseComp(91.2)、SpreadsheetBench 2(34.8)、Automation Bench(30.8)、DeepSearchQA(95.0)四项测试中均拿下第一。在综合性的GDPval-AA v2和AA-Briefcase中,K3位居第三,紧贴两款闭源旗舰,大幅领先Opus 4.8和GLM-5.2。

3.3 推理与视觉能力

基准测试 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
GPQA-Diamond 93.5 92.6 94.1 91.0
HLE-Full 43.5 53.3 44.5 49.8
HLE-Full w/ tools 56.0 63.0 58.0 57.9
OmniDocBench 91.1 89.8 85.8
MMMU-Pro 81.6 81.2 83.0 78.9
MathVision w/ Python 97.8 97.8

在OmniDocBench(文档理解)上,K3以91.1分超越Fable 5(89.8)和GPT-5.6 Sol(85.8)。在GPQA-Diamond(高难度科学推理)上拿到93.5%,是开源模型中的最佳成绩。

但在HLE(人类水平评测)上,K3(43.5)与Fable 5(53.3)差距明显——这是K3目前最大的短板之一。

3.4 综合智能指数:57分,全球第三

第三方评测机构Artificial Analysis给出的综合智能指数(Intelligence Index):

模型 智能指数 输出速度
Claude Fable 5 60
GPT-5.6 Sol 59
Kimi K3 57 ~62 tok/s
Claude Opus 4.8 56
GPT-5.5 ~55

K3以57分排在第三,介于Opus 4.8(56)与GPT-5.6 Sol(59)/Fable 5(60)之间。差距在2-4分之内。

月之暗面官方在发布博客中坦言:“K3的整体表现仍落后于最强闭源系统,但已在多项前沿任务上展现出稳定超越其他模型的能力。” 这种坦诚在国产大模型发布中实属清流。


四、与36号三强横评:K3在MoE格局中的位置

第36期我们横评了Qwen 3.7 Max、Kimi K2.7 Code和DeepSeek V4 Pro。现在K3来了,国产MoE的格局需要重新画:

维度 Qwen 3.7 Max DeepSeek V4 Pro Kimi K2.7 Code Kimi K3
总参数 ~600B+ 1.6T ~1T 2.8T
上下文 128K-1M 128K 256K 1M
编程强项 通用均衡 推理深度 编程专项优化 长程编程+前端
API输出价格 28元/MT 6元/MT 45元/MT 100元/MT
开源状态 部分开源 完全开源 API-only 7.27开源权重
Arena排名 🥇 1679

关键变化:

  1. 参数规模断层领先:K3的2.8T是DeepSeek V4 Pro的1.75倍,是K2.7 Code的近3倍。开源阵营的尺寸上限被直接拉到3T级。

  2. 价格策略转向:K3的API输出价格(100元/MT)是K2.7 Code(45元/MT)的2.2倍,也远高于DeepSeek V4 Pro(6元/MT)。月之暗面不再走低价路线,而是以能力溢价切入高端市场。

  3. 定位分化明确:DeepSeek V4 Pro继续做"极致性价比",Qwen 3.7 Max走"通用均衡",GLM-5.2做"编码+设计双料冠军",K3则定位"长程编程+全能旗舰"。四条路线、四种打法。

  4. 成本效率的真相:K3官方API的编程场景缓存命中率超90%,缓存命中时输入价格仅2元/MT(约$0.30)。实际使用中,输入成本可能低至标价的1/4。Artificial Analysis测算,K3单任务成本约$0.94,与GPT-5.6 Sol的$1.04接近,仅为Claude Opus 4.8($1.80)的一半。


五、API定价与成本分析:贵,但贵得有道理

5.1 官方API价格明细

人民币定价(每百万token):

项目 价格
输入(缓存命中) 2元
输入(缓存未命中) 20元
输出 100元

美元定价(每百万token):

项目 价格
输入(缓存命中) $0.30
输入(缓存未命中) $3.00
输出 $15.00

5.2 与闭源旗舰的价格对比

模型 输入(缓存命中) 输入(缓存未命中) 输出 K3相对便宜
Kimi K3 $0.30 $3.00 $15.00
Claude Fable 5 $1.00 $10.00 $50.00 输出便宜70%
GPT-5.6 Sol $0.50 $5.00 $30.00 输出便宜50%
Claude Opus 4.8 ~$35.00 输出便宜57%

K3的输出价格是Fable 5的30%、GPT-5.6 Sol的50%。缓存命中时输入价格仅为Fable 5的1/33。

5.3 与国产同行的价格对比

模型 混合价格($/MT) 定位
Kimi K3 ~$2.3 旗舰级
Qwen 3.7 Max ~$1.4 高端
GLM-5.2 ~$0.9 中高端
MiniMax M3 ~$0.22 性价比
DeepSeek V4 Pro ~$0.18 极致性价比

K3是国产模型中最贵的——但也是能力最强的。月之暗面的定价策略清晰:不再用低价换市场,而是用能力换溢价。

5.4 缓存命中率的"成本魔法"

K3依托Mooncake分离式推理架构,编程场景缓存命中率超过90%。这意味着:

  • 标称输入价格:$3.00/MT(缓存未命中)
  • 实际输入价格:约90% x $0.30 + 10% x $3.00 = $0.57/MT
  • 实际混合成本:远低于标称的$2.3/MT

在Kimi Code Bench V2上,K3以单次约$4取得72.9分;Fable 5达到76.9分但单次成本超过$10。K3的性价比(分数/美元)约为Fable 5的2倍


六、实操接入指南:OpenAI SDK双协议兼容

6.1 快速接入:三行代码跑通K3

K3的API完全兼容OpenAI SDK格式,迁移成本极低:

from openai import OpenAI

client = OpenAI(
    api_key="your-api-key",
    base_url="https://api.moonshot.ai/v1"  # Kimi官方API
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "你是一位资深全栈工程师。"},
        {"role": "user", "content": "用React + TypeScript实现一个带搜索过滤的无限滚动列表组件。"}
    ],
    temperature=1.0,
    top_p=1.0,
    max_completion_tokens=131072,
)

print(response.choices[0].message.content)

6.2 当前API的硬性约束

⚠️ 接入K3时必须注意以下参数限制(截至发稿时):

{
  "reasoning_effort": "max",
  "temperature": 1.0,
  "top_p": 0.95,
  "max_completion_tokens": 131072,
  "n": 1,
  "presence_penalty": 0,
  "frequency_penalty": 0
}

视觉输入注意:仅支持base64和ms://<file-id>格式,不接受公开URL图片。

Web搜索:官方提示"not recommended for production",生产环境建议自行实现搜索工具调用。

6.3 Agent场景接入示例

K3的100万token上下文 + Agent能力是其最大卖点。以下是一个量化研究Agent的接入示例:

tools = [
    {
        "type": "function",
        "function": {
            "name": "stockapi_kline",
            "description": "获取指定股票的K线数据",
            "parameters": {
                "type": "object",
                "properties": {
                    "symbol": {"type": "string", "description": "股票代码"},
                    "days": {"type": "integer", "description": "获取天数"}
                },
                "required": ["symbol", "days"]
            }
        }
    }
]

messages = [
    {
        "role": "system",
        "content": "你是A股量化研究员。可用工具:stockapi_kline获取K线数据。"
                   "任务:对指定股票做均线金叉/死叉分析,输出结构化报告。"
    },
    {
        "role": "user",
        "content": "分析贵州茅台(600519)近60个交易日的均线走势"
    }
]

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=messages,
    tools=tools,
    temperature=1.0,
    top_p=1.0,
)

6.4 视觉闭环编程:Vision in the Loop

K3最独特的工作模式之一是视觉闭环——模型生成代码后可以直接查看运行截图,识别布局、色彩和层级问题,再修改代码、再截图,如此反复迭代。

import base64

with open("screenshot.png", "rb") as f:
    image_data = base64.b64encode(f.read()).decode()

messages = [
    {
        "role": "user",
        "content": [
            {"type": "text", "text": "这是当前页面的截图,请根据截图中的布局问题修改CSS样式。"},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{image_data}"}}
        ]
    }
]

这种模式让K3在前端开发、游戏开发、CAD等场景中形成了独特的"看到→修改→再看→再改"的工作循环,与传统的"一次性输出代码"模式有本质区别。


七、三大硬核案例:MiniTriton、48小时芯片、科研复现

7.1 从零构建MiniTriton GPU编译器

K3从零构建了一个名为MiniTriton的类Triton GPU编译器,包含自定义tile级IR层(基于MLIR)、完整优化pass和PTX代码生成流水线。在Roofline基准测试中,性能持平甚至超越官方Triton和torch.compile,并能支撑nanoGPT端到端训练收敛。在K3开发后期,早期版本已承担团队大部分GPU内核优化工作——这是模型能力反哺研发流程的真实案例。

7.2 48小时自主完成芯片设计

连续48小时Agent自主运行,使用开源EDA工具+Nangate 45nm工艺库,独立完成芯片构建、优化与验证。4mm²面积内集成146万个标准单元+0.277MB SRAM,实现INT4 MAC阵列,100MHz时序收敛,仿真解码吞吐>8700 tokens/s。**由模型设计的芯片,为模型服务的芯片。**消息发布当天,Cadence暴跌9.47%,Synopsys暴跌7.85%。

7.3 两小时复现天体物理计算

K3用约两小时完成通常需要资深研究人员一到两周的工作——阅读二十多篇论文、整理三百多个状态方程、写出三千多行Python代码。

7.4 GPU内核优化实测

24小时沙箱中完成AttnRes、KDA和512头维度MLA内核在NVIDIA H200上的优化。AttnRes任务:前向+反向时间从283.6ms压缩到114.4ms。MLA-512内核:从零编写达到517.8 TFLOPS,超过H200理论BF16峰值一半,领先第二名492.7 TFLOPS。

八、官方坦承的三个局限

局限一:对思考历史敏感——K3在保留思考历史模式下训练。如果Agent框架未能完整回传历史思考内容,或在会话中途从不兼容模型切换到K3,生成质量可能大幅波动。建议使用Kimi Code等已验证兼容的框架。

局限二:过度主动——训练强调长周期高难度任务,遇到简单场景或模糊指令时可能替用户做出非预期决定。需要在system prompt中施加更明确的行为约束。

局限三:综合体验仍有差距——官方原文:尽管Kimi K3总体上是一个非常有竞争力的模型,但与Claude Fable 5和GPT-5.6 Sol相比,在用户体验上仍有一定差距。

对开发者的实际影响:(1)接入K3时必须确保Agent框架能完整传递thinking history;(2)System prompt需更精确地约束模型行为边界;(3)生产环境建议做充分回归测试。


九、开源在即:7月27日意味着什么

K3完整模型权重将于2026年7月27日正式开源,技术报告同步发布。意味着:(1)企业可私有化部署,数据完全不出域;(2)社区可做微调、蒸馏、量化、适配等二次开发;(3)但硬件门槛极高——2.8T参数即使MXFP4存储也需约1.4TB,官方推荐supernode配置(64+高端加速器);(4)vLLM适配方案已贡献社区。

对多数开发者,云端API仍是更现实的选择。但对金融、医疗、政务等数据敏感行业,私有化部署从合规要求变成了战略选择。

十、行业震动:从追赶到局部领跑

K3的发布引发了多层面连锁反应:

资本市场:K3发布当天,智谱股价暴跌28%,MiniMax下跌16%。投资者迅速重新评估中国大模型赛道的竞争格局。

全球评价:Arena AI CEO称其为可能是今年最重大的发布;卡内基梅隆大学教授、前苹果首任总监Russ Salakhutdinov(也是Kimi创始人杨植麟的CMU导师)称其为开源模型社区的重大胜利;高盛研报指出中国开源模型智能能力已达到全球大规模普及的关键转折点。

估值飙升:月之暗面半年内完成三级跳——2025年12月估值43亿美元→2026年5月D轮200亿美元→6月新一轮315亿美元。累计融资超370亿人民币,为AGI赛道融资最高的新创公司。

产品矩阵:K3不是孤立产品。K2.7 Code专攻编程(Token消耗降低30%),Kimi Work把Agent搬到桌面端(支持飞书/WPS/钉钉插件),Kimi信用卡(美国运通+农业银行联名)用积分换算力。

十一、开发者实操建议:什么场景该用K3

场景 推荐模型 理由
前端开发/Web设计 Kimi K3 Arena全球第一,视觉闭环独特
长程编程/大型代码库 Kimi K3 100万上下文 + SWE Marathon第一
极致性价比/日常推理 DeepSeek V4 Pro 输出仅$0.87/MT,便宜10倍
编码+设计双料需求 GLM-5.2 Code Arena + Design Arena双冠
通用均衡/中文场景 Qwen 3.7 Max 生态集成,中文能力突出
极致综合体验/预算充足 Claude Fable 5 综合智能60分,全球天花板
数据私有化/本地部署 等K3开源权重 2.8T级能力,开源可自托管

K3核心价值公式:接近Fable 5的编程能力 x 1/3的价格 x 开源可私有化 x 100万上下文 = 前端/长程编程场景最优解。

十二、写在最后:MoE第四极的启示

从DeepSeek R1到GLM-5.2,从Qwen 3到Kimi K3,国产开源MoE模型在过去一年完成了从追赶到并跑再到局部领跑的三级跳。

K3的定位很清晰:它不是全能冠军,但在编程和Agent赛道上,已经坐到了全球最靠前的位置。2.8万亿参数、100万token上下文、原生视觉理解、Arena代码榜第一——这些标签叠加在一起,让国产开源模型第一次在规模+能力+开放三个维度同时站到了世界之巅。

当然,K3距离全面超越Fable 5和GPT-5.6 Sol还有距离。综合智能57 vs 60的3分之差,HLE上43.5 vs 53.3的10分差距,FrontierSWE上81.2 vs 86.6的5分落差——这些都是下一步需要攻克的方向。

但方向已经明确,路径已经验证。7月27日权重开源,全球开发者社区将用自己的方式,给这个2.8万亿参数的开源巨兽写下新的注脚。

实操入口:K3刚开权重,先用中转跑通再迁移

K3完整权重7月27日才正式开放,API也刚上线不久——很多开发者的接入工作还在起步阶段。如果你正在做技术选型和API适配,不想在官方API注册充值上耗时间,也不想一上来就被$3/$15的单价烧预算做压测——可以先用点点词元中转跑通整条链路,等验证稳定了再迁回官方

点点词元(https://activity.ldzktoken.com/activity/index.html)是专门为大模型开发者做的API中转服务,同时兼容OpenAI SDK和Anthropic SDK双协议。接入K3只需改base_url和api_key两个配置,业务代码完全不动。

为什么这个阶段特别适合用中转:

  1. 双协议兼容:K3支持OpenAI和Anthropic两种格式,点点词元两种都能接
  2. 价格优势:比官方直充便宜20%-50%,K3这种高单价模型上差距更明显
  3. 多模型一站切换:K3做前端、DeepSeek做推理、Fable 5做对照——一个API Key搞定
  4. 迁移零成本:等7月27日K3权重开源、环境稳定后随时迁回官方

点点词元入口https://activity.ldzktoken.com/activity/index.html
K3的窗口期稍纵即逝——7月27日权重开源后社区会涌入大量适配需求。先用中转把链路跑通、参数踩熟,等官方生态成熟再做长期方案,这是当下最务实的技术路线。


点点词元技术专栏 · 第37期 · 数据来源:月之暗面官方技术博客、Artificial Analysis、Arena AI、felloai、博客园、CSDN、量子位

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐