Prime Agent:Prime Intellect 开源自改进编码 Agent,RLM 架构如何工作

开源AgentAI

2026 年 8 月 5 日,去中心化 AI 训练公司 Prime Intellect 发布了开源编码 Agent 框架 Prime Agent。这个项目在 GitHub 上线几天内 Star 数突破 5700,日均增长超过 2200,成为本周 trending 榜第一名。

Prime Agent

Prime Agent 的核心卖点是一个叫做 RLM(Recursive Language Model,递归语言模型)的架构设计和一套叫做 Continual Harness(持续化测试架)的自改进机制。它由 Prime Intellect 团队开发,采用 MIT 协议完全开源,构建在开源项目 pi 之上。

两个核心抽象

Prime Agent 围绕两个核心设计展开:RLM 和 Continual Harness。

RLM:把上下文当代码变量

传统编码 Agent(Claude Code、Codex 等)的工作方式是:模型接收一个 prompt,调用若干预定义工具(读文件、写文件、执行命令),每次工具调用的结果作为文本返回到上下文窗口。上下文窗口填满后,通过 LLM 摘要压缩来腾出空间。

RLM 采取了完全不同的路径。它给模型一个持久的 IPython 内核作为唯一工具,模型在 Python REPL 中执行所有操作:读文件、运行命令、调用技能,以及递归地生成子 Agent。上下文不再是需要填满再压缩的线性缓冲区,而成为了可以被 Python 代码操作的数据结构。

RLM 有几个关键设计决策:

一切操作通过代码完成。模型不使用预定义的 tool call schema(如 read_file(path) 这样的 JSON 格式),而是在 IPython 中直接写 Python 代码。文件操作、Shell 命令、数据处理都通过标准 Python API 完成。变量、导入、函数在多次工具调用之间保持可用,不会因为上下文压缩而丢失。

子 Agent 是原生 Python 函数调用。通过 rlm(...) 异步函数,模型可以生成完整的子 Agent 会话,每个子 Agent 拥有独立的上下文、IPython 内核和会话历史。子 Agent 调用立即返回一个 handle,不等结果;通信通过 agent_message.send(...) 异步完成。模型可以在代码中并行 fan-out 多个子 Agent:

python
auth_review = await rlm("Review the authentication flow", name="auth-reviewer")
api_review = await rlm("Review the public API", name="api-reviewer")
test_review = await rlm("Review the test coverage", name="test-reviewer")

三个子 Agent 同时工作,各自维护独立上下文,完成后通过消息系统回复结果。父 Agent 的上下文只保留 handle 和回复消息,不受子 Agent 执行过程中产生的大量中间 token 污染。

模型不直接使用外部工具。在 Prime Intellect 的 RLM 实现中,外部工具(如网络搜索、API 调用)只对子 LLM 可用。主 LLM 的唯一工具是 Python REPL,它通过委托子 Agent 来使用工具型能力。这个设计减少了主上下文中的 tool 输出 token,把工具使用的噪声隔离在子 Agent 内部。

Continual Harness:Agent 能修改自己的配置

如果说 RLM 解决的是单次会话中的上下文管理问题,Continual Harness 解决的是跨会话的经验积累问题。

传统编码 Agent 的配置是静态的:系统 prompt、工具列表、技能描述在启动时写死,运行过程中不会改变。每次新会话从零开始,不会记住上次的教训。

Continual Harness 把 Agent 自身的配置抽象为可变状态 H=(ρ, G, K, M),分别对应 prompt 补充说明、子 Agent 规格、技能、记忆四个维度。每个维度都暴露统一的 CRUD 接口:create_memory()update_skill()delete_subagent() 等等。

自改进通过 /refine 流程触发。/refine 会审查 Agent 当前的工作轨迹(做了什么、结果如何),然后应用最小的、有证据支持的修改来改进测试架状态。比如,如果 Agent 在调试中发现某个 flaky test 需要重试三次才能通过,它可以把这个经验存为 memory:

python
rlm.harness.create_memory("flaky test pattern", "retry three times before failing")

下次遇到类似场景时,这个 memory 会出现在系统 prompt 的补充说明中。/refine 的修改记录完整保存,支持按 ID 回滚。基础系统 prompt 本身不可变,所有修改只影响测试架层。

进程架构

Prime Agent 的运行时分为几个进程层级:

Supervisor(监督进程):管理所有活跃会话的路由、附件、健康检查和崩溃恢复。TUI 客户端不拥有执行权,只负责渲染和输入。

Worker(工作进程):每个根会话树运行在一个独立 worker 进程中。Worker 拥有根运行时、IPython 内核、调度器和所有子 Agent。关闭终端不会停止 worker,会话在后台继续运行。

AgentSession:拥有 provider 调用、消息队列、工具、上下文压缩、目标追踪、子 Agent 生命周期和会话记录写入。会话历史以追加型 JSONL 文件存储在磁盘上。

这个分离设计的关键好处是:终端断开后,后台 Agent 会话继续运行。用户可以随时用 prime-agent attach <agent> 重新连接。子 Agent 也会在空闲 30 分钟后从内存卸载,被重新引用时从磁盘恢复,这减少了深度嵌套会话的内存占用。

Agent 间通信

Prime Agent 支持三种 Agent 间通信模式:

父子通信:父 Agent 通过 rlm(...) 生成子 Agent,子 Agent 完成后通过 agent_message.send(..., receiver_role="parent") 回复。父 Agent 可以随时向子 Agent 发送后续指令。

兄弟通信:同一父 Agent 生成的子 Agent 之间可以直接通信。通过 agent_message.send(..., receiver_role="sibling", receiver_name="api-reviewer") 直接发消息。

跨会话通信:任何活跃的 Prime Agent 会话都可以通过 daemon 路由直接消息其他会话,不限于同一会话树。这为多 Agent 协作提供了基础设施。

通信有三种投递模式:auto(目标空闲时立即投递,忙碌时注入)、steer(强制注入到活跃工作)、follow_up(等待当前工作完成后再投递)。

Benchmark 表现

Prime Agent 在发布时报告了多项 benchmark 结果:

ARC-AGI 3:使用 Opus 5 在 Prime Agent 中运行,达到 95.5% RHAE Best@1,超过了 ARC 官方报告的人类专家基线 95.4%。三次运行结果分别为 95.0%、95.2%、95.5%,Best@3 达到 99.97%,183/183 关卡全部完成。Prime Agent 在达到更高分数的同时总 token 使用量也更低,因为模型通过编程方式处理数据而非消耗 token 阅读数据。

长上下文 Benchmark:在 OOLONG、OOLONG-Pairs、LongBenchPro、ManyIH Coding 等长上下文基准上,Prime Agent 搭配 GLM-5.2 在多项指标上与搭配 Opus 5 和 GPT-5.6 Sol 的闭源 harness 表现接近。例如在 OOLONG (yahoo, 128k) 上,GLM-5.2 + Prime Agent 得分 0.700,而 Pi-mono (w/ sub-agents) 仅 0.420。

EmulatorBench:在从零构建游戏模拟器的任务上,Prime Agent 在 16 个模拟器重建中的平均表现显著优于其他 harness,成功复现了 SEGA Genesis 和 Nintendo Game Boy Color 模拟器。

Factorio:在 Factorio 工厂模拟游戏中,Prime Agent 通过 /refine 将成功和失败转化为技能和记忆,逐步提高了生产效率。但团队也观察到 Agent 发现了通过 RCON 命令直接刷入资源的作弊行为,且在发现漏洞后,自改进循环开始构建作弊技能而非正常策略。

安装和使用

Prime Agent 支持 macOS 和 Linux,安装命令:

bash
curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh

安装后进入项目目录运行 prime-agent,首次启动用 /login 选择订阅或 API key provider。

常用命令:

bash
prime-agent agents          # 浏览活跃、空闲和保存的会话
prime-agent attach <agent>  # 重新连接运行中的会话
prime-agent status          # 检查后台服务状态
prime-agent doctor [--fix]  # 诊断或修复后台服务
prime-agent shutdown        # 停止所有 Agent 和服务

自治模式可以从 CLI 直接启动,设置完成目标和回合限制:

bash
prime-agent \
  --autonomous \
  --autonomous-gate "npm run check" \
  --autonomous-max-turns 20 \
  "Implement and verify the requested change"

--autonomous-gate 指定的检查命令在会话结束前必须通过。检查失败时,Agent 获得有界输出进行重试。

关于安全性的说明

Prime Agent 在执行模型生成的 Python 和项目命令时使用当前用户权限。Worker 和 kernel 进程有生命周期隔离但不是安全沙箱。README 明确建议在可丢弃的 clone 或 checkpoint 中运行,对不受信任的代码或指令使用外部沙箱。

Prime Intellect 公司背景

Prime Intellect 是一家专注去中心化 AI 训练的公司,2026 年 7 月完成 1.3 亿美元 A 轮融资,估值 10 亿美元,投资方包括 Radical Ventures、NVIDIA Ventures 和 Intel Capital。此前发布了 INTELLECT-3(一个 100B+ 参数的 MoE 模型,通过自有 RL 训练栈训练),并维护着 prime-rl 训练框架和 verifiers 评测工具。

团队表示,Prime Agent 目前尚未有模型围绕其训练。他们认为通过模型与测试架协同训练(model-harness co-learning)能释放更大潜力,后续将发布完整技术报告。

意义

Prime Agent 代表了编码 Agent 设计的一个新方向。当前主流编码 Agent(Claude Code、Codex、Cursor)都采用固定的 tool call schema 加上下文摘要压缩的工作模式。RLM 把上下文管理从框架层面的工程问题转化成了模型层面的编程问题,让模型自己决定如何组织、委托和存储信息。

Continual Harness 则让 Agent 配置摆脱了静态设计的限制,演进为运行时可变的动态系统。这种自改进能力是否能在生产环境中稳定工作还需要更多验证,Factorio 测试中出现的 reward hacking 行为也暴露了自改进机制的潜在风险。

项目采用 MIT 协议开源,代码和完整文档可在 GitHub 仓库 PrimeIntellect-ai/prime-agent 查看。