标签: 推理优化

清除筛选

NVIDIA Model Optimizer 拆解:NVFP4 量化的 Local-Hessian 算法与 AutoQuantize 混合精度搜索

同一个 70B 模型,BF16 精度需要约 140GB 显存才能放下,4-bit 量化后只要 40GB 左右,推理吞吐还能再往上走一截。代价是精度损失,而损失的多少几乎完全取决于量化工具链的质量。NVIDIA Model Optimizer(ModelOpt)是 NVIDIA 把自家的量化、剪枝、蒸馏、投机解码技术整合成的开源工具库,2025 年 1 月开源…

GLM 自建推理基础设施解读:10 万张国产加速卡上的三倍吞吐与 Infra Agent

Z.ai 在 9 月 17 日的官方博客里给出了一份少见的工程复盘:GLM-5.3-Flash 的全部生产推理,跑在一个由超过 10 万张国产 AI 加速卡组成的集群上,推理服务从模型首次跑通到上线只用了不到两周,端到端吞吐量相对基线提升了约三倍。更特别的是,干这活的不只是一支基础设施团队——大部分调优工作由一个由 GLM-5.3 驱动的 Infra Age…

本地 LLM 实测:注意力后端、KV Cache 量化与 4-bit 权重的精度漂移

同一份模型权重,在官方演示里对答如流,部署到本地却频繁表现失常:长上下文读到后半段输出开始漂移,量化版本连工具调用都闭合不了。Level1Techs 论坛上一篇带完整数据的受控实验《Why your local LLM feels dumber than it is》把原因指向了推理软件栈:从注意力算子到量化 kernel,每一层都在改变下一个 token…

oMLX:为 Apple Silicon 而生的本地 LLM 推理服务器,分层 KV 缓存把上下文复用推到 85%

在 Mac 上跑本地大模型的人大多经历过同一个瓶颈:模型加载得再快,长对话一来一回,上下文一遍遍重新计算,GPU 算力都花在了重复劳动上。oMLX 是一个专为 Apple Silicon 设计的 LLM 推理服务器,它的核心卖点就落在这一点上:分层 KV 缓存把已计算的上下文块持久化到 SSD,换对话、换模型、甚至重启服务器之后,历史上下文仍然可以直接复用,…

DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 57% 至 85%

DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 60% 至 85% 大语言模型生成文本时逐 token 串行计算,推理延迟随输出长度线性增长,这是 AI 对话系统响应偏慢的根本原因之一。推测解码是一条已知的加速路径:用轻量草稿模型快速生成若干候选 token,再由完整规模的大模型通过单次并行前向传播批量验证,接受符合目标分布的连…