NVIDIA Model Optimizer 拆解:NVFP4 量化的 Local-Hessian 算法与 AutoQuantize 混合精度搜索
同一个 70B 模型,BF16 精度需要约 140GB 显存才能放下,4-bit 量化后只要 40GB 左右,推理吞吐还能再往上走一截。代价是精度损失,而损失的多少几乎完全取决于量化工具链的质量。NVIDIA Model Optimizer(ModelOpt)是 NVIDIA 把自家的量化、剪枝、蒸馏、投机解码技术整合成的开源工具库,2025 年 1 月开源…





