NVIDIA 软件优化将 DeepSeek V4 Token 成本降至五分之一NVIDIA 在 Blackwell 平台上持续优化推理软件栈,一个月内将 DeepSeek V4 的 Token 生成成本降至原先的五分之一。 PyTorch 社区发布的基准数据显示,在 GB300 NVL72 离散式部署下,SGLang 引擎的吞吐量从 4 月初(Day-0)的约 2,200 Tokens/秒/GPU 提升至 6 月的约 11,200 T…2026/07/01DeepSeekNVIDIABlackwell推理优化SGLang
DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 57% 至 85%DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 60% 至 85% 大语言模型生成文本时逐 token 串行计算,推理延迟随输出长度线性增长,这是 AI 对话系统响应偏慢的根本原因之一。推测解码是一条已知的加速路径:用轻量草稿模型快速生成若干候选 token,再由完整规模的大模型通过单次并行前向传播批量验证,接受符合目标分布的连…2026/06/27开源AIDeepSeek推理优化