Meta 开源 Muse Glimmer:可在消费级 GPU 上运行的 30B 本地智能体模型

Muse Glimmer

2026 年 8 月 10 日,Meta 超级智能实验室(Meta Superintelligence Labs)发布 Muse Glimmer,一款拥有 300 亿参数的稠密语言模型。模型权重以 Apache 2.0 许可证开放,目前已在 Hugging Face 提供下载。

Muse Glimmer 的定位很明确:面向本地智能体工作流(agent workflow)。它被优化为可以在配备单张消费级 GPU 的 Mac 或 PC 上运行,支持工具调用、编程、多模态输入和多语言任务。Meta 称,模型经量化后占用内存低于 20 GB,可在 24 GB 或 32 GB 内存的设备上流畅运行。

从 Muse Spark 到 Muse Glimmer:蒸馏训练路径

Muse Glimmer 并非从零训练。Meta 采用了从其旗舰模型 Muse Spark 进行知识蒸馏的方式,将大模型的推理能力迁移到这个更紧凑的架构中。训练分为三个阶段:

预训练阶段,Muse Glimmer 使用 Muse Spark 的输出进行 logit 蒸馏,采用与教师模型类似的数据配比。Logit 蒸馏让小模型学习大模型输出的概率分布,相比仅学习最终预测结果,能传递更丰富的知识信号。

中间训练阶段,模型在更长上下文、更多智能体任务的数据上训练,包含更丰富的推理链路(reasoning traces),同时混入有机数据。

后训练阶段,Meta 结合了监督微调(SFT)和策略蒸馏(on-policy distillation)以及强化学习(RL),覆盖通用、推理、编程和智能体四个领域。

Benchmark 表现:同级别模型对比

Meta 将 Muse Glimmer(30B)与 Google Gemma4(31B)和 Qwen3.6(27B)进行了对比评测。

Benchmark对比

通用智能体能力是 Muse Glimmer 的优势区域。在 MCP-Atlas(75.5 vs 54.2/62.5)和 DeepSearch QA(74.6 vs 61.7/71.1)等测试中,Muse Glimmer 明显领先。GAIA2 测试中拿到 43.3 分,同样排在第一。τ-Bench Banking 测试中三者得分都不高(23.5/15.1/16.7),但 Muse Glimmer 仍然领先。

编程类智能体测试中,SWE-Bench Verified 得分 76.0,与 Qwen3.6 的 77.2 接近,远超 Gemma4 的 66.6。SWE-Bench Pro 测试中 Muse Glimmer 以 51.2 领先。不过 TerminalBench 2.1 上 Qwen3.6(60.7)表现更好,OSWorld-Verified 同样是 Qwen3.6(75.6)领先。

多模态能力方面,三者差距较小。SciCode 测试中 Muse Glimmer 以 43.6 略胜一筹,Charxiv Reasoning(78.8)和 ScreenSpot Pro(75.4)的表现与对手接近。

通用推理中,AIME 2026 数学测试 Muse Glimmer 拿到 94.7,GPQA Diamond 83.5,IFBench 77.0。Humanity's Last Exam 三家都在 22-24 分区间,目前对所有模型都是难题。

BenchmarkMuse Glimmer 30BGemma4 31BQwen3.6 27B
MCP-Atlas75.554.262.5
DeepSearch QA74.661.771.1
SWE-Bench Verified76.066.677.2
SWE-Bench Pro51.236.950.2
AIME 202694.789.294.1
IFBench77.076.070.8
GAIA243.336.440.0

量化方案:从 55 GB 压到 17 GB

一个 300 亿参数的模型,全精度运行需要超过 55 GB 内存,远超任何消费级 GPU 的容量。Meta 提供了两档量化方案:

量化方案

方案目标硬件准确率损失
全精度64 GB VRAM基线
K-Quant-Dynamic32 GB VRAM0.2%
K-Quant-17GB24 GB VRAM1.0%

K-Quant-Dynamic 将模型压缩到约 4-bit 精度,内存占用低于 20 GB,准确率损失仅 0.2%。这给 KV cache、感知编码器(perception encoder)和投机解码 drafter 留出了足够空间,全部可以在 24 GB 或 32 GB 内存环境中同时运行。

K-Quant-17GB 方案进一步压缩到 17 GB,适配更低的内存环境,代价是 1.0% 的准确率损失。Meta 在 15 项常用基准上取平均评估了压缩后的表现退化。

DFlash 投机解码:推理速度提升 1.5-3.1 倍

本地模型要实用,光能跑起来还不够,速度也得够快。Meta 引入了 DFlash 投机解码技术:一个轻量级的 drafter 网络一次性提出整块 token,主模型并行验证,接受正确的部分并修正错误的部分。这种方法的输出质量与逐 token 生成完全相同,速度却有显著提升。

DFlash加速效果

硬件基础速度DFlash 加速后加速倍数
RTX 509074.9 tok/s233 tok/s3.1x
M5-Max26.6 tok/s50 tok/s1.8x
M4-Max23.7 tok/s38 tok/s1.5x

RTX 5090 上的加速效果最显著,达到 3.1 倍。Apple Silicon 平台也分别获得了 1.5-1.8 倍的提升。M4 和 M5 的测试基于 ExecuTorch 框架,RTX 5090 基于 llama.cpp。

生态与部署

Muse Glimmer 已在 Hugging Face 开放下载。未来几天内,llama.cpp、MLX 和 ExecuTorch 的优化集成将陆续上线。开发者可以通过 Ollama、LM Studio、Unsloth 等工具在本地运行,也可以通过 vLLM、SGLang 进行规模化部署,或通过 Together AI、Fireworks AI、OpenRouter 等云平台快速上手。

硬件合作方面,Meta 正在与 AMD、Arm、Dell、Intel 和 NVIDIA 合作优化跨设备性能。开发者文档也已同步发布。

来源:Meta AI Research · The New York Times