标签
热门推荐
- Anthropic 洽谈由三星代工自研 AI 芯片7/2/2026
- 长鑫存储拿下腾讯200亿DRAM大单:IPO前的战略绑定6/29/2026
- xAI 开源 Grok Build:Rust 编写的终端编程代理7/15/2026
- 苹果 A20 Pro 改用 WMCM 封装,内存移至芯片侧面改善散热6/27/2026
- 美国政府要求 OpenAI 分阶段发布 GPT-5.66/26/2026
- OPPO 整合一加与真我系统,全球统一启用 ColorOS7/3/2026
- Anthropic 获美国政府批准,恢复 Mythos 5 模型对关键基础设施组织的部署6/27/2026
- 腾讯玄武阿图因AI在CyberGym测试中超越Mythos7/3/2026
标签: Blackwell
清除筛选- Gating — Top-k 专家选择与评分,用于 Mixture of Experts 路由
- MoE Routing — Token-to-Expert 映射、融合扩展/归约、权重归一化
- Quantization — Per-token、p
NVIDIA 软件优化将 DeepSeek V4 Token 成本降至五分之一
NVIDIA 在 Blackwell 平台上持续优化推理软件栈,一个月内将 DeepSeek V4 的 Token 生成成本降至原先的五分之一。
PyTorch 社区发布的基准数据显示,在 GB300 NVL72 离散式部署下,SGLang 引擎的吞吐量从 4 月初(Day-0)的约 2,200 Tokens/秒/GPU 提升至 6 月的约 11,200 Tokens/秒/GPU。在保持用户约 50 Tokens/秒的高流畅交互体验下,性能提升 5 倍,单 Token 成本降至约 $0.156/百万输出 Token(8K 输入 / 1K 输出配置)。

