Qwen3.8 27B 量化实测:4-bit 无损,1-bit 崩到随机线以下

把一个 55GB 的开源模型压到 17GB,跑分几乎不动;继续压到 6.2GB,它的成绩掉到瞎猜水平以下。Quesma 工程师 Piotr Migdał 8 月 26 日发表的实测,把阿里千问 Qwen3.8 27B 的五个量化档位逐个放上三个基准,量出了这条异常清晰的分界线。整轮测试在 Modal 租用 GPU 上完成,llama.cpp 推理,总计烧掉约 3000 美元,其中 Terminal-Bench 2.1 一项就花费 2308 美元,GPQA Diamond 与 IFBench 合计 663 美元。

Qwen3.8 27B 满血版与 2-bit 量化版生成的"骑自行车鹈鹕"对比

测的东西:从 55GB 到 6.2GB 五个档位

Qwen3.8 27B 是千问今年开源的 dense 架构模型,Apache 2.0 协议,Hugging Face 官方仓库下载量已超过 670 万次。模型原生支持视觉输入和 256K 上下文,训练精度 BF16 下权重文件重 55GB,一张消费级显卡装不下。Unsloth 在 Hugging Face 上维护的 GGUF 量化仓库补齐了从 6.2GB 到 55GB 的全部档位,仓库下载量超过 1000 万次,文件名里 Q4_K_M、UD-Q2_K_XL、UD-IQ1_S 这些后缀对应不同的位宽和压缩策略。

这次实测选了五个代表性档位:Q8_0(8-bit,29GB)、Q4_K_M(4-bit,17GB)、UD-Q2_K_XL(2-bit,10.7GB)、UD-IQ1_S 和 UD-IQ1_M(1-bit,6.2GB/6.x GB),对照 55GB 的 BF16 满血版。量化做的事情是把模型权重从 16-bit 浮点压到更低精度存储,推理时再反量化计算,省的是显存和内存,赌的是精度损失对下游任务影响有限。

测试工具是 llama.cpp(2026 年 8 月 16 日之后的 build,更早的版本跑不动这个模型),KV cache 统一用 F16 不量化,32000 token 上下文约占 2.3GB。跑分环境横跨三种卡:48GB 显存的 L40S、80GB 的 H100 和 141GB 的 H200。

三个基准:4-bit 无损,2-bit 开始分化

三个基准各管一个方向。GPQA Diamond 是博士级科学选择题,测知识推理;IFBench 测指令遵循;Terminal-Bench 2.1 是 89 个任务的真实终端环境 agentic 编程基准,每任务 3 小时超时,保留 98K 上下文。

GPQA Diamond 得分随模型体积的变化,虚线为随机猜测水平

结果分三层。第一层,Q4_K_M 在三个基准上全部与 BF16 打平:GPQA Diamond 上作者首次运行就复现了千问官方报告的满血版成绩,17GB 版本落在同样的置信区间内;Terminal-Bench 2.1 上 4-bit 同样复现官方值,Q8_0 那一档被作者跳过——挤在 4-bit 与满血之间,插值即可,单独再跑一轮纯属烧钱。

第二层,UD-Q2_K_XL 开始出现可见但有限的退化。IFBench 上 2-bit 依然与满血版无异(这项测试的上下文很短,4K token 左右);GPQA Diamond 上 2-bit 略低于其他档位;Terminal-Bench 2.1 上出现明显下滑,但作者指出其得分仍与 Claude Opus 4.7、Gemini 3.1 Pro 相当。过程数据同样有意思:同样解对的题目,2-bit 模型写的输出 token 多出约四分之一,轮次数基本持平。模型没变笨到解不了题,只是变得更啰嗦。

第三层,1-bit 崩塌。这条放到下一节,因为它值得单独展开。

1-bit 悬崖:推理越长,答案越差

UD-IQ1_M 在 GPQA Diamond 上的得分是 27% 左右,刚好卡在 25% 随机猜测线上方;UD-IQ1_S 掉到 10% 上下,低于随机水平。一个多项选择题测试里的模型连瞎猜都不如,说明它的输出分布已经系统性偏离正确答案。

更反直觉的是推理努力(reasoning effort)的影响。Qwen3.8 默认的 xhigh 推理档在满血和 4-bit 上都是最优设置,在 1-bit 上却起了反作用:xhigh 的得分反而低于 low 档。原因是推理链越长,量化损伤累积越多,模型经常一路推理到 token 预算耗尽,返回一个空答案。知识类基准上这条曲线尤其陡——量化对知识存底的破坏同样是非线性的:先测不出变化,再小幅下滑,最后断崖。

Unsloth 对 1-bit 档位的官方描述是:UD-IQ1_S 仅 6.2GB,体积缩小 89%,保留约 72% 的 top-1 准确率。这套说法在 token 预测层面或许成立,但这次实测给出的答案是:剩下的 28% 恰好是解题能力所在。r/LocalLLaMA 上用户的反馈用了更直接的说法,把 1-bit 版称作 "brain damage quant"(脑损伤量化)。

还有一个容易踩的坑:Unsloth 在 8 月 19 日替换过 v2 量化文件,这次测试用的大部分文件已经从 Hugging Face 下架, replaced 后的版本与实测对象存在版本差异。复现这类测试时,锁定具体文件 revision 比锁定仓库名更重要。

成本账:3000 美元买来的数据

这轮测试的总开销约 3000 美元,全部走 Modal 租用 GPU。分项上,Terminal-Bench 2.1 占 2308 美元,GPQA Diamond 加 IFBench 合计 663 美元。作者顺带公布了自己的实测速度与单位成本:从 L40S 到 H200,随卡档次不同,单流速度从每秒个位数 token 到几十 token 不等,作者实际用多条并行流替代 Multi-Token Prediction(MTP 单流快,并行流总吞吐更高),核心约束始终是显存装得下模型加 KV cache。

横向对比更有参考价值:OpenRouter 上最便宜的渠道跑 DeepSeek V4 Flash 0731(284B 参数),输出价格约 0.1 美元/百万 token。本地跑 27B 省下的是按 token 计费,付出的是电费、显存和明显更高的单位推理成本。作者没有下结论哪种划算,只把两组数字并排放在一起——这个账每个自己部署的人都得算一遍。

Unsloth GGUF 仓库提供的量化档位列表

给本地部署者的四个结论

第一,24GB 显存(RTX 4090 这类)直接上 Q4_K_M:17GB 装进卡里还能留出约 64K token 上下文,三个基准零损失,无脑选它。

第二,16GB 内存的机器跑 UD-Q2_K_XL:写代码类任务会感觉到退化(token 多写四分之一,Terminal-Bench 得分下滑),问答和指令遵循任务几乎无感。

第三,1-bit 档位不要用于任何严肃任务。6.2GB 的诱惑很大,但 25% 随机线以下的 GPQA 得分意味着它连选择题都做不好,而且推理开得越足错得越离谱。

第四,推理努力档位的影响大于量化档位。默认 xhigh 在正常量化下多花约 8000 推理 token 换最高分,但代价是响应时间和 token 消耗;什么时候该调低,这次数据显示 4-bit 以上的模型至少值得逐任务试一轮 medium。

KV cache 量化(这次统一未量化)是作者留下的下一个实验,低比特 KV 对长上下文的损伤传闻已久,等那份数据出来,这张显存账还要再修一版。

来源: