DeepSeek 开源 TileKernels:面向 Blackwell 架构的高性能 LLM 算子库
DeepSeek 于 4 月 23 日在 GitHub 上开源了高性能 GPU 算子库 TileKernels,基于 TileLang 框架开发。该库针对大语言模型的训练与推理场景进行了深度优化,算子性能已接近硬件计算强度与内存带宽的极限。
核心特性
TileKernels 的算子覆盖范围相当广泛:
- Gating — Top-k 专家选择与评分,用于 Mixture of Experts 路由
- MoE Routing — Token-to-Expert 映射、融合扩展/归约、权重归一化
- Quantization — Per-token、per-block、per-channel 的 FP8/FP4/E5M6 量化转换,含融合 SwiGLU+量化算子
- Transpose — 批量转置操作
- Engram — Engram 门控算子,含融合 RMSNorm、前向/反向传播和权重梯度归约
- Manifold HyperConnection — 超连接算子,含 Sinkhorn 归一化和混合拆分/应用
- Modeling — 高层 torch.autograd.Function 封装,将底层算子组合为可训练层(Engram Gate、mHC Pipeline)
值得注意的是,该库不仅包含基础算子,还包含了 Engram 和 Manifold HyperConnection 等 DeepSeek 特有的架构创新实现。这意味着开源社区现在可以直接获取 DeepSeek 在训练栈底层的核心组件,对复现和理解 DeepSeek 模型的工程实现具有重要价值。
硬件与软件要求
| 项目 | 要求 |
|---|---|
| GPU 架构 | NVIDIA SM90 (Hopper) 或 SM100 (Blackwell) |
| CUDA | 13.1 及以上 |
| Python | 3.10 及以上 |
| PyTorch | 2.10 及以上 |
| TileLang | 0.1.9 及以上 |
SM100 即 NVIDIA 最新的 Blackwell 架构,TileKernels 是目前少数明确支持该架构的开源算子库之一。CUDA 13.1 和 PyTorch 2.10 的要求也暗示了这是面向下一代训练基础设施的工具链。
项目结构
tile_kernels/
├── moe/ # MoE 路由相关算子
├── quant/ # FP8/FP4/E5M6 量化
├── transpose/ # 批量转置
├── engram/ # Engram 门控算子
├── mhc/ # Manifold HyperConnection 算子
├── modeling/ # 高层 autograd 建模层
├── torch/ # PyTorch 参考实现
└── testing/ # 测试与基准测试工具评价
TileKernels 的开源体现了 DeepSeek 一贯的策略:在发布模型和论文的同时,逐步开放支撑其训练推理的基础设施。从 DeepSeek-V2 的 MLA/MoE 实现,到 DeepSeek-R1 的推理优化,再到如今的 TileKernels 算子库,DeepSeek 正在系统性地将其工程积累贡献给开源社区。
对于研究者和工程师而言,TileKernels 的价值在于:
- 学习参考:了解 DeepSeek 如何在底层实现高效的 MoE 路由、量化和注意力机制
- 生产复用:基于 TileLang 的 Python DSL,算子的开发和迁移成本相对较低
- Blackwell 适配:为下一代 GPU 架构的算子开发提供了可参考的实现
不过需要注意的是,项目 README 中也坦言:"它们并不代表最佳实践,我们正在积极改进代码质量和文档。" 作为 Initial commit 阶段的项目,TileKernels 更像是一个工程参考而非开箱即用的生产库。
安装
bash
# 开发版本
pip install -e ".[dev]"
# 发布版本
pip install tile-kernels许可证
MIT License
推荐阅读
- xAI 开源 Grok Build:Rust 编写的终端编程代理7/15/2026
- 华为开源 920 亿参数 openPangu-2.0-Flash 模型6/30/2026
- OpenSEO:5800 Star 的开源 SEO 工具,10 美元/月挑战 Semrush 与 Ahrefs7/20/2026
- DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 57% 至 85%6/27/2026
- 华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码7/20/2026
- Hallmark:一份写给AI编码助手的反AI味设计手册7/17/2026
- Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成7/19/2026
- OmniRoute:日增 1300+ Star 的开源 AI 网关,一个端点接通 250 个模型提供商7/20/2026
- AI 代码审查的 token 困境:code-review-graph 如何用代码图谱砍掉 98% 的上下文7/20/2026
- 27B 模型塞进手机:PrismML Bonsai 27B 把权重压到 1-bit7/18/2026
- 6.4 万 Star 的开源全球情报平台:World Monitor 架构与能力全景7/21/2026
- KTransformers:单 GPU 跑 671B MoE 模型的清华方案7/21/2026
- Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺7/19/2026
- Kimi K3 首登 DeepSWE v1.1:开源权重模型挤进前三7/18/2026
- GPT-5.6用一段十页提示词,关闭凸优化30年的复杂性缺口7/19/2026
- jcode:用 Rust 重写的 AI 编码代理,内存占用仅为 Claude Code 的 1/147/22/2026
- AI 连破三大数学猜想:Jacobian 猜想 87 年反例与形式化验证的新时代7/21/2026
- B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴7/18/2026
- transcribe.cpp:一个 ggml 运行时跑完 16 个语音转文字模型家族7/19/2026
- Moonshine Micro:80美分芯片跑完整语音流水线,500KB内存装下VAD+STT+TTS7/18/2026
- LingBot-Map:用前馈3D基础模型做流式重建,20FPS跑完一万帧7/18/2026
- Linux登顶2026 CVE漏洞榜:内核维护者称这是好事7/4/2026
- NVIDIA 软件优化将 DeepSeek V4 Token 成本降至五分之一7/1/2026
- F-Droid将Google ADV定性为恶意软件:40亿设备已被预装7/5/2026
- 字节跳动开源 Lance:3B 参数统一图像视频理解生成与编辑5/22/2026
- Kimi K2.7 Code 开源:代码基准全面提升,token 消耗降 30%6/12/2026
- MiniMax M3 发布:1M 上下文 + 原生多模态 + 前沿 Coding6/1/2026
- 小米发布 Xiaomi OneVL 一步式潜空间推理框架并全面开源5/13/2026
- TanStack npm 供应链攻击复盘:Pwn Request + 缓存投毒 + OIDC 内存提取的完整攻击链5/12/2026
- DeepSeek 拟融资超 500 亿,6 月将发布 V4.1 更新5/8/2026