NVIDIA 软件优化将 DeepSeek V4 Token 成本降至五分之一NVIDIA 在 Blackwell 平台上持续优化推理软件栈,一个月内将 DeepSeek V4 的 Token 生成成本降至原先的五分之一。 PyTorch 社区发布的基准数据显示,在 GB300 NVL72 离散式部署下,SGLang 引擎的吞吐量从 4 月初(Day-0)的约 2,200 Tokens/秒/GPU 提升至 6 月的约 11,200 T…2026/07/01DeepSeekNVIDIABlackwell推理优化SGLang
DeepSeek 开源 TileKernels:面向 Blackwell 架构的高性能 LLM 算子库DeepSeek 于 4 月 23 日在 GitHub 上开源了高性能 GPU 算子库 TileKernels,基于 TileLang 框架开发。该库针对大语言模型的训练与推理场景进行了深度优化,算子性能已接近硬件计算强度与内存带宽的极限。 核心特性 TileKernels 的算子覆盖范围相当广泛: Gating — Top-k 专家选择与评分,用于 Mix…2026/04/23开源DeepSeekGPU算子Blackwell