Meta 发布 Muse Code:异步持久代理架构,用 event log 重定义 coding agent 的可靠性

Meta 在 2026 年 8 月 5 日发布了 Muse Code beta,一款终端 AI 编程代理,同时推出驱动它的模型 Muse Spark 1.2。这是 Meta 首次进入 agentic coding 这一正在快速商品化的品类,直接对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex。

异步持久代理:不一样的 agent 循环

Muse Code 的核心架构决策是 async background agents(异步持久背景代理)。大多数竞争产品在遇到子任务时临时 spawn 一个新的 agent,处理完就销毁。Muse Code 反其道行之,在整个 session 期间维持一组专用的背景代理,它们持续活跃、自主执行下一步操作,只在有结果或需要人工决策时才与主代理通信。

这种设计减少了重复的信息收集。一个已经理解了仓库结构的背景代理,不需要在每次被调用时重新探索代码库。Meta 将其描述为"less latency and less babysitting"。

当任务足够大时,Muse Code 会将工作扇出(fan out)到多个并行子代理,每个子代理在独立的 git worktree 中工作,互不干扰,开发者的工作副本始终保持干净。Mark Zuckerberg 在 X 上展示了同时为同一个游戏项目构建 6 个功能、无文件冲突的演示。

Event Log:每次操作都可审计、可回放

第二个关键设计是 append-only event log。Muse Code 将每次模型调用、工具运行、审批和编辑在执行前就追加到本地 event log 中,形成单一的事实来源(single source of truth)。日志格式为 JSONL,存储在 ~/.local/share/muse/sessions/ 下,可以用 jq 直接查询。

这意味着两件事:一是完全可审计,工程管理者可以回溯每个子代理做了什么、什么时候做的;二是崩溃安全(crash-safe),如果 Muse Code 在一个持续 20 小时的任务中崩溃,下一次 session 会从日志中精确恢复到中断点,无需重新输入 prompt。

Muse Spark 1.2:与 harness 协同训练的编码模型

Muse Spark 1.2 是 Muse Spark 1.1 的编码优化版本,Meta 在编码任务上显著扩大了训练算力,同时扩展了训练环境多样性。模型覆盖多文件重构、长时间调试、超出单个 prompt 范围的长任务等编码代理最常处理的工作负载。

两个训练细节值得注意。第一,Meta 将 Muse Code 本身纳入了训练循环,使用 rejection-sampled harness trajectories 和针对 goals、context compaction、sub-agents 的 recipe optimization 进行协同训练。模型在 Muse Code 内表现最佳,但仍能泛化到其他编码代理。这反映了行业趋势:模型和 harness 不再是独立产品。

第二,Meta 使用了 self-improvement loop。Muse Spark 1.1 生成具有挑战性的编码环境和指令遵循模板,然后对候选方案进行评分,产出可扩展的训练数据集用于训练 1.2。Meta 认为这一循环使 1.2 在遵循复杂指令方面有显著提升。

模型支持 1M token 上下文窗口,能在一个 session 中持有依赖图、遗留代码和数千个文件。Muse Spark 1.2 是推理模型,思考 token 按 output 计费,用户可以通过 /effort 参数控制推理深度。

Benchmark 表现

Meta 发布了 Terminal-Bench 2.1、DeepSWE 1.1 和内部编码基准的对比图表。各模型在 Terminal-Bench 2.1 上的得分如下:

模型关联工具Terminal-Bench 2.1
Claude Opus 5 (max)Claude Code86.7%
Muse Spark 1.2Muse Code82.9%
GPT-5.6 Terra (max)Codex81.8%
Grok 4.5 (high)Grok Build81.6%
Gemini 3.6 Flash (high)Antigravity CLI78.9%
Muse Spark 1.1mini-swe-agent76.2%

Terminal-Bench 2.1 对比

在 DeepSWE 1.1 上:

模型关联工具DeepSWE 1.1
Claude Opus 5 (max)Claude Code65.0%
GPT-5.6 Terra (max)Codex64.8%
Muse Spark 1.2Muse Code59.3%
Grok 4.5 (high)Grok Build56.6%
Muse Spark 1.1mini-swe-agent53.0%
Gemini 3.6 Flash (high)Antigravity CLI40.0%

DeepSWE 1.1 对比

Terminal-Bench 2.1 上 Muse Spark 1.2 与 GPT-5.6 Terra 仅差 1.1 个百分点,与 Claude Opus 5 差距 3.8 个百分点。DeepSWE 1.1 上的差距更大,落后 Opus 5 约 5.7 个百分点。独立验证平台 kingy.ai 指出,Meta 报告的分数来自自建评估框架,Claude Fable 5 在独立验证的 Terminal-Bench 2.1 上以 83.8% 领先,而 Meta 自测为 82.9%,两者尚未在统一条件下直接对比。

长时间自主运行案例

Meta 展示了一个 GPU kernel 优化案例。Muse Spark 1.2 在 NVIDIA Hopper 硬件上对 KDA 和 MLA kernel 进行自主优化,持续运行超过 1000 次工具调用(最长 24 小时)。模型被禁止直接包装 FLA 等第三方 kernel 库,必须从零开始用 Triton 实现算法。

在 MLA kernel 上,Muse Spark 1.2 设计了一个两阶段 Triton 流水线,将标准 kernel fusion 和 tiling 与 MLA 专用优化结合,包括复用 shared KV latent 同时作为 K 和 V。在 KDA kernel 上,模型采用了 chunk-parallel preparation kernel 配合顺序 inter-chunk scan,并在 chunk 中点重新居中 gated cumulative decay。

Zuckerberg 表示 agent 在初始探索阶段之后仍能持续找到显著改进。长时间自主运行中不出现性能平台期或 drift,是编码代理领域的一个关键挑战。

定价策略

Muse Spark 1.2 提供两个定价层级:

  • 标准层:$0.15/1M cached input,$1.25/1M input,$4.25/1M output。此层的数据不用于模型训练,无长上下文溢价,速率限制为每团队每分钟 3000 请求和 400 万 token。
  • 贡献层(Contributor):通过降低 token 费用换取 Meta 使用 prompt 和 completion 数据训练模型。按滚动 5 小时窗口内的 token 用量限速,而非请求计数。

标准层价格处于市场中间水平。贡献层的逻辑类似于 Llama 时代的生态策略:以免费权重换取社区采用,现在变成了以廉价 token 换取训练数据。

与竞争对手的架构对比

目前终端编程代理市场的主要玩家和它们的架构特点:

  • Claude Code(Anthropic):专有模型 + 专有 harness,市场先行者
  • Codex CLI(OpenAI):Apache 2.0 开源 harness + 专有模型,gpt-oss 权重开源
  • Grok Build(xAI):专有模型 + 专有 harness
  • Gemini CLI(Google):Apache 2.0 开源 harness + 专有模型
  • Muse Code(Meta):专有模型 + 专有 harness,异步持久代理 + event log 审计

Meta 在开源性上走了一条与 Llama 时代相反的路。Zuckerberg 的 Threads 和 X 帖子均未出现"open"一词,没有权重、没有许可证。而 OpenAI 已将 Codex CLI 以 Apache 2.0 开源并推出 gpt-oss 权重模型,Google 的 Gemini CLI 同样采用 Apache 许可。

可用性

Muse Code 在 macOS 和 Linux 上通过一条 curl 命令安装,需要 Meta 账户和绑卡。Muse Spark 1.2 同时在 Meta Model API 和 OpenRouter 上线,全球访问权限已扩大。开发者可在 dev.meta.ai 获取 API key。

来源:Meta AI Research Blog · Meta Developer Blog · VentureBeat