标签: Blackwell

清除筛选
    NVIDIA 软件优化将 DeepSeek V4 Token 成本降至五分之一
    NVIDIA 软件优化将 DeepSeek V4 Token 成本降至五分之一

    NVIDIA 在 Blackwell 平台上持续优化推理软件栈,一个月内将 DeepSeek V4 的 Token 生成成本降至原先的五分之一。

    PyTorch 社区发布的基准数据显示,在 GB300 NVL72 离散式部署下,SGLang 引擎的吞吐量从 4 月初(Day-0)的约 2,200 Tokens/秒/GPU 提升至 6 月的约 11,200 Tokens/秒/GPU。在保持用户约 50 Tokens/秒的高流畅交互体验下,性能提升 5 倍,单 Token 成本降至约 $0.156/百万输出 Token(8K 输入 / 1K 输出配置)。

    ![SemiAnalysis Infe

    DeepSeek 开源 TileKernels:面向 Blackwell 架构的高性能 LLM 算子库
    DeepSeek 开源 TileKernels:面向 Blackwell 架构的高性能 LLM 算子库

    DeepSeek 于 4 月 23 日在 GitHub 上开源了高性能 GPU 算子库 TileKernels,基于 TileLang 框架开发。该库针对大语言模型的训练与推理场景进行了深度优化,算子性能已接近硬件计算强度与内存带宽的极限。

    核心特性

    TileKernels 的算子覆盖范围相当广泛:

    • Gating — Top-k 专家选择与评分,用于 Mixture of Experts 路由
    • MoE Routing — Token-to-Expert 映射、融合扩展/归约、权重归一化
    • Quantization — Per-token、p