对比之一:开源前排没有西方名字
开源权重模型的榜单前排,长期被中国实验室占据:GLM 5.2/5.3、Kimi K3、Qwen 3.8-Max、DeepSeek V4.1。西方阵营里有 Meta 的 Llama 系列和 Mistral,但在"前沿能力"这一档,已经落后一个身位。这是 2026 年 AI 行业一个少有人正面处理的结构性事实。
Reflection AI 在 10 月 5 日发布的 Beam,目标就是填这个空缺。这是这家公司的第一个开源权重模型:稀疏 MoE(混合专家)架构,总参数 501B,每个 token 激活 23B,主打编程、推理和智能体任务。权重承诺本月在 Apache 2.0 许可下放出,同时附上技术报告、模型卡和完整的运行、评测、微调工具链。
先看官方公布的定位数据。Reflection 的说法是:Beam 推进了"西方开源权重前沿",在编程和智能体任务上与更大的 GLM 5.2 有竞争力,接近 Qwen 3.8-Max;同时承认 Kimi K3 在原始能力上仍然领先。Beam 换来的是另一个东西:推理效率。

对比之二:同样的分数,更少的计算
Beam 的核心叙事可以概括成同一档的分数、明显更低的推理开销。官方给出的关键句是:在进阶推理基准上,Beam 达到与 GLM-5.2 相当的分数,使用的推理计算少 3 到 4 倍。对 2T+ 参数家族的 Qwen 3.8-Max,效率差距更大。
这里先解释 MoE 为什么重要。MoE 模型的总参数决定"装了多少知识",激活参数决定"每生成一个 token 花多少计算"。Beam 501B 总参只激活 23B,对照 GLM-5.2 的 744B 总参/40B 激活(TechCrunch 引用的数字),Beam 每个 token 的计算负担约是对方的一半。推理成本按 token 计费的用户,看到的账单差距会直接反映这个结构差异。
官方基准表(数据均出自 Reflection 发布公告,NR 为未报告):
| 基准 | Beam | GLM 5.3 | Kimi K3 | Qwen 3.8 Max |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 61.0 | 68.0 | 51.0 |
| SWE-Bench Pro v2-Hard | 77.2 | 84.3 | 88.2 | NR |
| Terminal Bench v2.1 | 80.1 | 88.2 | 88.3 | 86.6 |
| SWEBench Verified | 80.9 | NR | NR | NR |
| AIME 2026 | 97.8 | NR | NR | NR |
| HLE(无工具) | 36.2 | 42.3 | 46.9 | 43.6 |
| GPQA Diamond | 90.5 | 91.7 | 93.5 | 92.6 |
| MCP Atlas | 78.7 | 84.2 | 82.3 | 84.5 |
表格读法:推理类基准(AIME、GPQA)Beam 已经贴住第一梯队;编程和智能体类(DeepSWE、Terminal Bench、MCP Atlas)落后 GLM 5.3 和 Kimi K3 一个可见的档次。Reflection 对此没有回避,官方口径明确写了"Kimi K3 在原始能力上保持领先"。
效率优势有两组佐证。其一,Reflection 引用 Artificial Analysis 和 DataCurve 的数据绘制了 FLOPS 与 token 数两个维度的效率对比,估算口径是"前向计算 ≈ 2 × 激活参数 × 平均生成 token 数",并在图注里说明了排除 prefill 和注意力开销的近似性质。其二,吞吐数据:Reflection 称 Beam 在内部服务中跑出每 GPU 每天超过 20,000 token 的生成量,按其口径为开源模型中最快。这类自报数据在第三方复测前只能当参考,但方向与其他模型的生产部署经验一致:小激活参数的 MoE 在吞吐上天然占优。
一次教科书级的 RL scaling
Beam 更有长期价值的部分是其训练方法。Reflection 把"高计算强化学习"当作与预训练并列的 scaling 轴,这次 RL 阶段的投入规模如下:
- 10,500 块 NVIDIA GB300 GPU,连续训练 4 周
- 生成超过 1 亿次 rollouts(智能体与环境交互的完整尝试过程)
- 最大上下文长度 256K token
- 训练与评分共用了约 13 亿次 sandbox(隔离执行环境)
- 训练环境库:100 万个编程、智能体和 STEM 环境
Reflection 称这是开源实验室迄今最大规模的 RL 运行之一。比总量更重要的是曲线形状:官方公布的图 3 显示,随着累计 rollouts 从零爬到 8000 万(覆盖 Beam 推理专家训练全过程的 80%),Terminal-Bench 2.1、HLE、DeepSWE 三个基准的分数持续上升,没有出现平台期。对照数据也放在同一张图里:Inkling(Thinking Machines Lab 7 月发布的开源模型)用了 3000 万 rollouts,MiMo 用了 75.3 万。RL 投入量的差距是数量级的,而 Beam 的曲线还没有弯。

支撑这条曲线的是两个工程细节。
第一是异步策略梯度的稳定性问题。超大规模 RL 里,经验数据是"过期"的:一个长 rollout 里,前面的 token 由旧版模型生成,等这批数据回流训练时,策略已经更新了几十版。这种 staleness(陈旧度)是训练不稳定的主要来源,加上训练引擎与推理引擎的数值误差,通常的做法是用同步训练把陈旧度压到最低,代价是 GPU 大量空转等待。Reflection 的做法是反过来的:新算法让训练在高度陈旧的数据上保持稳定,实测数据是陈旧一天、落后当前策略 107 个权重版本的样本,训练数值依然稳定。等于把"等 GPU"这个瓶颈直接拆掉了,这是能把 4 周连续 RL 跑满的工程前提。
第二是推理长度的可控性。Beam 训练时用了可控长度惩罚:奖励解对题,同时对多余 token 施加成本。训练早期的曲线分两个阶段:分数上升的同时生成长度在下降,说明模型先学会了"用更少的思考把题做对";后期生成长度回升,多出来的 token 换来了更高的分数上限。两条曲线合成一条可调的帕累托前沿,落到产品上就是 reasoning effort 参数:用户按任务难度和预算调节思考长度。
还有一个超出预期的观察:RL 阶段完全没有训练浏览类任务,Beam 的网页浏览能力却跟着涨了。官方 demo 里,Beam 在带网访问的环境里自发学会了调用搜索引擎、查询其他 LLM、用 OCR API 读文档。能力在域间迁移,这是"RL 学到的是通用智能体能力而非题库"这个假设迄今少见的直接证据之一。
权重没放出之前,哪些是实数哪些是口号
现在能确认的事实边界:权重、技术报告、模型卡、安全评测都还没放出,目前所有 benchmark 数字来自 Reflection 自报,TechCrunch 在报道中明确写了"性能主张未经独立验证"。Beam 正在做最后的红队测试,早期访问靠注册等待。
几家对照方的数据同样来自各家自报,跨榜单可比性有限。Inkling 的对比还有一个维度差异:它是多模态模型,Beam 是纯文本,两者的分数表并不完全对齐。
这笔账的下半段在商业侧。TechCrunch 的背景信息:Reflection 2024 年由两位前 Google DeepMind 研究员创立,总部布鲁克林,累计融资约 47 亿美元(投资方含 NVIDIA、红杉、Lightspeed,PitchBook 口径),最近一轮投前估值 250 亿美元。今年夏天与 SpaceX 和 Nebius 签下合计超 70 亿美元的算力合同,锁定到 2029 年的 GB300 供应。这个算力储备解释了"4 周 1 亿 rollouts"从哪来。
Reflection 的产品路线也不是卖 API 一条路,主打的是"AI factory"(AI 工厂):让企业和政府机构用自己的私有数据在本地训练和部署 Reflection 的模型,韩国新世界集团已在试点。Axios 的报道称对冲基金和交易公司是第一批积极客户。这个路线下,"开源权重"的实际含义是给买家一个可私有部署的基座,商业闭环在部署服务而不是模型本身。
本月的权重发布有三个验证点:第三方榜单上 Beam 的自报分数能否复现;Apache 2.0 放出的权重是完整版还是裁剪版;微调工具链的完整度。开源权重模型的竞争走到 2026 年,发布时的博客数字越来越漂亮,发布后的复测差距也越来越诚实。