全球首个 3T 级开源模型:Kimi K3 权重正式开放
2026 年 7 月 27 日,月之暗面(Moonshot AI)在 Hugging Face 开放 Kimi K3 的模型权重。这是目前参数规模最大的开源 AI 模型,总参数量 2.8 万亿(2.8T),官方称其为全球首个开放的 3T 级前沿模型。权重采用修改版 MIT 许可证发布,允许免费下载、部署和微调。

K3 面向长程编程、知识工作和复杂推理三类任务,原生支持工具调用、网页浏览和多步规划等 agentic 能力。模型于 7 月 16 日在 WAIC 2026(上海世界人工智能大会)上发布 API,11 天后开放完整权重。
架构:KDA + Attention Residuals + Stable LatentMoE
K3 的 2.8T 参数并非简单的规模堆叠。月之暗面引入了三项架构创新来支撑这个规模。
Kimi Delta Attention (KDA)
KDA 是一种混合注意力机制,主体使用线性注意力(计算成本随序列长度线性增长),穿插周期性的全注意力层。传统全注意力(Full Attention)的计算量随序列长度呈平方级增长,在百万 Token 上下文场景下成本极高。KDA 在月之暗面此前发布的 Kimi Linear 研究模型中,将 KV 缓存占用降低了最高 75%,在百万上下文解码速度提升至对比系统的 6 倍。
Attention Residuals (AttnRes)
AttnRes 改变了信息在模型层间的传递方式。传统 Transformer 中,每一层的输出作为下一层的输入逐层累积,深层信息容易出现退化或丢失。AttnRes 让模型跨层选择性检索已有表征,而非逐层均匀累积。这种设计使 2.8T 参数规模的超深网络能够保持训练稳定性和推理质量。
Stable LatentMoE
K3 采用稀疏混合专家(MoE)架构,每个 Token 只激活 896 个专家中的 16 个。配合 Stable LatentMoE 框架,模型引入了 Quantile Balancing(从路由器分数分位数直接推导专家分配,消除启发式更新)和 Per-Head Muon(逐注意力头独立优化)等训练技术,保证万亿参数规模下的训练稳定性。
三项架构改进合计带来了相对于 K2 约 2.5 倍的整体扩展效率提升——同样的计算量能转化为更多能力。

训练精度方面,K3 从 SFT 阶段起即采用量化感知训练(quantization-aware training),使用 MXFP4 权重和 MXFP8 激活值,保证广泛的硬件兼容性。月之暗面推荐在 64 块以上加速器的超节点(supernode)配置上部署推理。同时,团队向 vLLM 社区贡献了 KDA 的前缀缓存实现,与模型同步发布。
Benchmark 表现:哪些赢了,哪些没赢
数据来自月之暗面官方技术博客。对比对象包括 Claude Fable 5、GPT 5.6 Sol、Claude Opus 4.8、GPT 5.5 和 GLM-5.2。
| Benchmark | Kimi K3 | Fable 5 | GPT 5.6 Sol | Opus 4.8 | GPT 5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 70.8 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 83.4 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 64.9 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 14.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | 84.4 | — |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 93.5 | 91.2 |
| HLE-Full | 43.5 | 53.3 | 44.5 | 49.8 | 41.4 | — |
| MMMU-Pro | 81.6 | 81.2 | 83.0 | 78.9 | 81.2 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 22.7 | 12.9 |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 | 29.1 | 28.1 |
K3 领先的项目集中在长程工程类(SWE Marathon 42.0,领先 Fable 5 的 35.0 和 GPT 5.6 Sol 的 39.0)、浏览与搜索类(BrowseComp 91.2、DeepSearchQA 95.0)和自动化类(Automation Bench 30.8、SpreadsheetBench 2 34.8)。这些任务需要模型在多步骤工作流中持续输出和调用工具。
K3 落后的项目主要是 FrontierSWE(81.2 vs Fable 5 的 86.6)和 HLE-Full(43.5 vs Fable 5 的 53.3),两者在闭源模型的强项上仍有明显差距。DeepSWE 方面,K3 的 67.5 落后于 GPT 5.6 Sol 的 73.0。
月之暗面在技术博客中明确表示,K3 的整体表现仍然落后于 Claude Fable 5 和 GPT 5.6 Sol。在 Artificial Analysis Intelligence Index 独立评测中,K3 以约 57 分排第四,落后于 Fable 5(约 59.9)和 GPT-5.6 Sol Max(约 58.9)。
开源意味着什么
K3 的 API 定价为每百万输入 Token 3 美元,每百万输出 Token 15 美元,缓存命中输入降至 0.30 美元。开源权重后,开发者可以在自己的服务器上部署,完全脱离 API 依赖。
实际部署成本取决于硬件。2.8T 参数即使在 MXFP4 量化下也需要大量显存。月之暗面建议 64 块以上加速器组成的超节点。这意味着完整的本地部署目前只有大型企业和研究机构能承担,但社区后续的量化方案(如 GGUF)可能会逐步降低门槛。
K3 的开源对 vLLM 生态有直接贡献。月之暗面向 vLLM 社区提交了 KDA 前缀缓存的实现代码,使该推理框架能够原生支持 KDA 架构的高效服务。这条路径如果走通,其他基于线性注意力的模型也能从中受益。
参数规格速览
| 规格 | 数值 |
|---|---|
| 总参数 | 2.8 万亿 |
| 每 Token 激活专家 | 16 / 896 |
| MoE 框架 | Stable LatentMoE |
| 上下文窗口 | 1,048,576 Token(约 100 万) |
| 默认最大输出 | 131,072 Token |
| 注意力机制 | Kimi Delta Attention (KDA) |
| 深度机制 | Attention Residuals (AttnRes) |
| 训练精度 | MXFP4 权重 / MXFP8 激活 |
| 许可证 | 修改版 MIT |
Hugging Face 模型页面:moonshotai/Kimi-K3
技术博客与 Benchmark 数据来源:openlm.ai/kimi-k3(月之暗面官方技术博客镜像)