
2026 年 8 月 10 日,Meta 超级智能实验室(Meta Superintelligence Labs)发布 Muse Glimmer,一款拥有 300 亿参数的稠密语言模型。模型权重以 Apache 2.0 许可证开放,目前已在 Hugging Face 提供下载。
Muse Glimmer 的定位很明确:面向本地智能体工作流(agent workflow)。它被优化为可以在配备单张消费级 GPU 的 Mac 或 PC 上运行,支持工具调用、编程、多模态输入和多语言任务。Meta 称,模型经量化后占用内存低于 20 GB,可在 24 GB 或 32 GB 内存的设备上流畅运行。
从 Muse Spark 到 Muse Glimmer:蒸馏训练路径
Muse Glimmer 并非从零训练。Meta 采用了从其旗舰模型 Muse Spark 进行知识蒸馏的方式,将大模型的推理能力迁移到这个更紧凑的架构中。训练分为三个阶段:
预训练阶段,Muse Glimmer 使用 Muse Spark 的输出进行 logit 蒸馏,采用与教师模型类似的数据配比。Logit 蒸馏让小模型学习大模型输出的概率分布,相比仅学习最终预测结果,能传递更丰富的知识信号。
中间训练阶段,模型在更长上下文、更多智能体任务的数据上训练,包含更丰富的推理链路(reasoning traces),同时混入有机数据。
后训练阶段,Meta 结合了监督微调(SFT)和策略蒸馏(on-policy distillation)以及强化学习(RL),覆盖通用、推理、编程和智能体四个领域。
Benchmark 表现:同级别模型对比
Meta 将 Muse Glimmer(30B)与 Google Gemma4(31B)和 Qwen3.6(27B)进行了对比评测。

通用智能体能力是 Muse Glimmer 的优势区域。在 MCP-Atlas(75.5 vs 54.2/62.5)和 DeepSearch QA(74.6 vs 61.7/71.1)等测试中,Muse Glimmer 明显领先。GAIA2 测试中拿到 43.3 分,同样排在第一。τ-Bench Banking 测试中三者得分都不高(23.5/15.1/16.7),但 Muse Glimmer 仍然领先。
编程类智能体测试中,SWE-Bench Verified 得分 76.0,与 Qwen3.6 的 77.2 接近,远超 Gemma4 的 66.6。SWE-Bench Pro 测试中 Muse Glimmer 以 51.2 领先。不过 TerminalBench 2.1 上 Qwen3.6(60.7)表现更好,OSWorld-Verified 同样是 Qwen3.6(75.6)领先。
多模态能力方面,三者差距较小。SciCode 测试中 Muse Glimmer 以 43.6 略胜一筹,Charxiv Reasoning(78.8)和 ScreenSpot Pro(75.4)的表现与对手接近。
通用推理中,AIME 2026 数学测试 Muse Glimmer 拿到 94.7,GPQA Diamond 83.5,IFBench 77.0。Humanity's Last Exam 三家都在 22-24 分区间,目前对所有模型都是难题。
| Benchmark | Muse Glimmer 30B | Gemma4 31B | Qwen3.6 27B |
|---|---|---|---|
| MCP-Atlas | 75.5 | 54.2 | 62.5 |
| DeepSearch QA | 74.6 | 61.7 | 71.1 |
| SWE-Bench Verified | 76.0 | 66.6 | 77.2 |
| SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| AIME 2026 | 94.7 | 89.2 | 94.1 |
| IFBench | 77.0 | 76.0 | 70.8 |
| GAIA2 | 43.3 | 36.4 | 40.0 |
量化方案:从 55 GB 压到 17 GB
一个 300 亿参数的模型,全精度运行需要超过 55 GB 内存,远超任何消费级 GPU 的容量。Meta 提供了两档量化方案:

| 方案 | 目标硬件 | 准确率损失 |
|---|---|---|
| 全精度 | 64 GB VRAM | 基线 |
| K-Quant-Dynamic | 32 GB VRAM | 0.2% |
| K-Quant-17GB | 24 GB VRAM | 1.0% |
K-Quant-Dynamic 将模型压缩到约 4-bit 精度,内存占用低于 20 GB,准确率损失仅 0.2%。这给 KV cache、感知编码器(perception encoder)和投机解码 drafter 留出了足够空间,全部可以在 24 GB 或 32 GB 内存环境中同时运行。
K-Quant-17GB 方案进一步压缩到 17 GB,适配更低的内存环境,代价是 1.0% 的准确率损失。Meta 在 15 项常用基准上取平均评估了压缩后的表现退化。
DFlash 投机解码:推理速度提升 1.5-3.1 倍
本地模型要实用,光能跑起来还不够,速度也得够快。Meta 引入了 DFlash 投机解码技术:一个轻量级的 drafter 网络一次性提出整块 token,主模型并行验证,接受正确的部分并修正错误的部分。这种方法的输出质量与逐 token 生成完全相同,速度却有显著提升。

| 硬件 | 基础速度 | DFlash 加速后 | 加速倍数 |
|---|---|---|---|
| RTX 5090 | 74.9 tok/s | 233 tok/s | 3.1x |
| M5-Max | 26.6 tok/s | 50 tok/s | 1.8x |
| M4-Max | 23.7 tok/s | 38 tok/s | 1.5x |
RTX 5090 上的加速效果最显著,达到 3.1 倍。Apple Silicon 平台也分别获得了 1.5-1.8 倍的提升。M4 和 M5 的测试基于 ExecuTorch 框架,RTX 5090 基于 llama.cpp。
生态与部署
Muse Glimmer 已在 Hugging Face 开放下载。未来几天内,llama.cpp、MLX 和 ExecuTorch 的优化集成将陆续上线。开发者可以通过 Ollama、LM Studio、Unsloth 等工具在本地运行,也可以通过 vLLM、SGLang 进行规模化部署,或通过 Together AI、Fireworks AI、OpenRouter 等云平台快速上手。
硬件合作方面,Meta 正在与 AMD、Arm、Dell、Intel 和 NVIDIA 合作优化跨设备性能。开发者文档也已同步发布。