Kimi K3 深度解读:2.8万亿参数开源模型的架构与Benchmark

全球首个 3T 级开源模型:Kimi K3 权重正式开放

2026 年 7 月 27 日,月之暗面(Moonshot AI)在 Hugging Face 开放 Kimi K3 的模型权重。这是目前参数规模最大的开源 AI 模型,总参数量 2.8 万亿(2.8T),官方称其为全球首个开放的 3T 级前沿模型。权重采用修改版 MIT 许可证发布,允许免费下载、部署和微调。

Kimi K3 Benchmark

K3 面向长程编程、知识工作和复杂推理三类任务,原生支持工具调用、网页浏览和多步规划等 agentic 能力。模型于 7 月 16 日在 WAIC 2026(上海世界人工智能大会)上发布 API,11 天后开放完整权重。

架构:KDA + Attention Residuals + Stable LatentMoE

K3 的 2.8T 参数并非简单的规模堆叠。月之暗面引入了三项架构创新来支撑这个规模。

Kimi Delta Attention (KDA)

KDA 是一种混合注意力机制,主体使用线性注意力(计算成本随序列长度线性增长),穿插周期性的全注意力层。传统全注意力(Full Attention)的计算量随序列长度呈平方级增长,在百万 Token 上下文场景下成本极高。KDA 在月之暗面此前发布的 Kimi Linear 研究模型中,将 KV 缓存占用降低了最高 75%,在百万上下文解码速度提升至对比系统的 6 倍。

Attention Residuals (AttnRes)

AttnRes 改变了信息在模型层间的传递方式。传统 Transformer 中,每一层的输出作为下一层的输入逐层累积,深层信息容易出现退化或丢失。AttnRes 让模型跨层选择性检索已有表征,而非逐层均匀累积。这种设计使 2.8T 参数规模的超深网络能够保持训练稳定性和推理质量。

Stable LatentMoE

K3 采用稀疏混合专家(MoE)架构,每个 Token 只激活 896 个专家中的 16 个。配合 Stable LatentMoE 框架,模型引入了 Quantile Balancing(从路由器分数分位数直接推导专家分配,消除启发式更新)和 Per-Head Muon(逐注意力头独立优化)等训练技术,保证万亿参数规模下的训练稳定性。

三项架构改进合计带来了相对于 K2 约 2.5 倍的整体扩展效率提升——同样的计算量能转化为更多能力。

Kimi K3 Architecture

训练精度方面,K3 从 SFT 阶段起即采用量化感知训练(quantization-aware training),使用 MXFP4 权重和 MXFP8 激活值,保证广泛的硬件兼容性。月之暗面推荐在 64 块以上加速器的超节点(supernode)配置上部署推理。同时,团队向 vLLM 社区贡献了 KDA 的前缀缓存实现,与模型同步发布。

Benchmark 表现:哪些赢了,哪些没赢

数据来自月之暗面官方技术博客。对比对象包括 Claude Fable 5、GPT 5.6 Sol、Claude Opus 4.8、GPT 5.5 和 GLM-5.2。

BenchmarkKimi K3Fable 5GPT 5.6 SolOpus 4.8GPT 5.5GLM-5.2
DeepSWE67.570.073.059.067.046.2
Program Bench77.876.877.671.970.863.7
Terminal Bench 2.188.384.688.884.683.482.7
FrontierSWE81.286.671.366.764.967.3
SWE Marathon42.035.039.040.014.013.0
BrowseComp91.288.090.484.384.4
GPQA-Diamond93.592.694.191.093.591.2
HLE-Full43.553.344.549.841.4
MMMU-Pro81.681.283.078.981.2
Automation Bench30.829.129.727.222.712.9
SpreadsheetBench 234.834.732.431.629.128.1

K3 领先的项目集中在长程工程类(SWE Marathon 42.0,领先 Fable 5 的 35.0 和 GPT 5.6 Sol 的 39.0)、浏览与搜索类(BrowseComp 91.2、DeepSearchQA 95.0)和自动化类(Automation Bench 30.8、SpreadsheetBench 2 34.8)。这些任务需要模型在多步骤工作流中持续输出和调用工具。

K3 落后的项目主要是 FrontierSWE(81.2 vs Fable 5 的 86.6)和 HLE-Full(43.5 vs Fable 5 的 53.3),两者在闭源模型的强项上仍有明显差距。DeepSWE 方面,K3 的 67.5 落后于 GPT 5.6 Sol 的 73.0。

月之暗面在技术博客中明确表示,K3 的整体表现仍然落后于 Claude Fable 5 和 GPT 5.6 Sol。在 Artificial Analysis Intelligence Index 独立评测中,K3 以约 57 分排第四,落后于 Fable 5(约 59.9)和 GPT-5.6 Sol Max(约 58.9)。

开源意味着什么

K3 的 API 定价为每百万输入 Token 3 美元,每百万输出 Token 15 美元,缓存命中输入降至 0.30 美元。开源权重后,开发者可以在自己的服务器上部署,完全脱离 API 依赖。

实际部署成本取决于硬件。2.8T 参数即使在 MXFP4 量化下也需要大量显存。月之暗面建议 64 块以上加速器组成的超节点。这意味着完整的本地部署目前只有大型企业和研究机构能承担,但社区后续的量化方案(如 GGUF)可能会逐步降低门槛。

K3 的开源对 vLLM 生态有直接贡献。月之暗面向 vLLM 社区提交了 KDA 前缀缓存的实现代码,使该推理框架能够原生支持 KDA 架构的高效服务。这条路径如果走通,其他基于线性注意力的模型也能从中受益。

参数规格速览

规格数值
总参数2.8 万亿
每 Token 激活专家16 / 896
MoE 框架Stable LatentMoE
上下文窗口1,048,576 Token(约 100 万)
默认最大输出131,072 Token
注意力机制Kimi Delta Attention (KDA)
深度机制Attention Residuals (AttnRes)
训练精度MXFP4 权重 / MXFP8 激活
许可证修改版 MIT

Hugging Face 模型页面:moonshotai/Kimi-K3

技术博客与 Benchmark 数据来源:openlm.ai/kimi-k3(月之暗面官方技术博客镜像)