智谱确认 Ox Alpha 为 GLM 新迭代:OpenRouter 用量登顶,今晚开源权重
一周登顶:23.2T tokens 的匿名模型
OpenRouter 本周使用量榜单(数据截至 8 月 25 日)出现了一个此前没有过的情况:排名第一的模型没有厂商署名、没有定价、没有参数规模披露。匿名模型 Ox Alpha 本周处理了 23.2T tokens,排名第二的 DeepSeek V4 Flash 0731 为 11.6T,恰好只有它的一半。DeepSeek 在榜的三个变体(V4 Flash 0731、V4 Flash 0423、V4 Pro 0423)合计约 19T,同样没能追上这一个匿名模型。

8 月 26 日,彭博社报道,智谱(Bloomberg 行文中的 Z.AI Co., also known as Zhipu)向该社确认:Ox Alpha 是其 GLM 系列的新一轮迭代,并将在今晚放出模型权重。一场持续六天的社区侦探游戏就此收场。
匿名上线:免费、1M 上下文、多模态
Ox Alpha 于 8 月 20 日晚间出现在 OpenRouter 模型目录,路由 ID 为 stealth/ox-alpha,OpenRouter 模型页标注的发布日期为 8 月 21 日。产品规格激进:104.8 万 token 上下文窗口,支持文本、图像、视频输入,预览期输入输出全部免费。官方口径是免费预览约一周,后续定价尚未公布。

这种发布方式在 OpenRouter 已有先例。今年 2 月,匿名模型 Pony Alpha 上线,最终被 OpenRouter 揭晓为智谱 GLM-5 的早期测试版本。Ox Alpha 是该平台约六个月内出现的第五个 stealth 模型,此前几个马甲最终都被确认来自中国厂商,包括小米投放的两个 MiMo 测试模型。
社区指纹:五条证据链
在官方确认之前,社区已经从五个独立方向把证据指向智谱:
- Tokenizer 指纹。不同模型家族的分词器面对同一段文本会留下稳定的 token 计数特征。测试者用 25 组不同 Prompt 对比发现,Ox Alpha 与 GLM-5.3 的 token 计数呈固定 +75 偏移,差值恰好可以被模型外部附加的一段隐藏 System Prompt 解释。
- 视频编码行为。Ox Alpha 的视频 token 行为(采样方式、时长与分辨率缩放)与智谱 GLM-5V-Turbo 一致,提示两者共享多模态处理栈的组件。
- 错误码方言。给 API 传入错误的 role 字段时,Ox Alpha 返回 code 1214 的 Incorrect role information 报错,与 Z.ai 托管的 GLM 模型在 OpenRouter 上的报错格式完全一致;而 DeepInfra 托管的同权重 GLM-5.2 返回的是 pydantic 校验错误。同一套权重、不同运营方、不同错误格式,说明 Ox Alpha 直接运行在 Z.ai 的服务栈上。
- 服务层泄露。一次报错的 Java 堆栈跟踪中暴露了智谱内部 API 类名。
- 行为残留。有用户声称在推理输出中捕捉到 trained by Z.ai 字样。这一条来自社区截图与二手转述,证据等级低于前四条。
跑分与争议
一项包含 10 个真实软件工程任务的社区测试中,Ox Alpha 完成 8 个,得分 80%;同一组任务里 Claude Fable 5 为 65%,GLM-5.3 为 62%,GPT-5.6 Sol 为 52%。样本只有 10 道题,不属于官方 Benchmark,数字仅供参考。
第三方榜单 Kingbench 上,Ox Alpha 拿到 87.5%,低于 GLM-5.3 的 91.25%。反方声音同样存在:Abacus.AI CEO Bindu Reddy 公开表示实测低于预期,部分指标只达到较早一代模型的水平;沃顿商学院教授 Ethan Mollick 的评价是惊艳程度一般。也有开发者报告它在低推理强度下表现平平,视觉任务明显弱于 Gemini 系列。
本周完整榜单
| 排名 | 模型 | 厂商 | 本周 tokens | 周变化 |
|---|---|---|---|---|
| 1 | Ox Alpha | 智谱(匿名投放) | 23.2T | 新上榜 |
| 2 | DeepSeek V4 Flash 0731 | DeepSeek | 11.6T | 3% |
| 3 | MiMo-V2.5 | 小米 | 9.92T | 82% |
| 4 | Hy3 | 腾讯 | 7.16T | 27% |
| 5 | DeepSeek V4 Flash 0423 | DeepSeek | 5.58T | 17% |
| 6 | Nemotron 3 Ultra (free) | 英伟达 | 5.4T | 100% |
| 7 | GPT-5.6 Luna | OpenAI | 4.16T | 28% |
| 8 | GLM 5.2 | 智谱 | 3.22T | 26% |
| 9 | Gemini 3.7 Flash | 2.58T | 210% | |
| 10 | DeepSeek V4 Pro 0423 | DeepSeek | 1.84T | 29% |
前十名里有七个模型来自中国厂商(智谱两个、DeepSeek 三个、小米一个、腾讯一个)。OpenRouter 的使用量重心已经实质转移。
免费换流量,隐私有口径分歧
OpenRouter 模型页顶部的黄色提示写明:该 stealth 模型由第三方模型提供商开发运营,提示词与补全内容会被提供商保留,但不会用于训练,其余用途受 Stealth Model Terms 约束。OpenCode 通道则宣称零数据保留。两份口径不一致,预览期内不建议传入敏感代码。
对智谱来说,这笔交换是划算的:免费换真实生产流量压测,匿名换无偏评测,揭晓换事件营销。GLM-5.2 目前在该榜单排名第八,新一代模型以匿名身份完成了一次全球规模的冷启动。
今晚放权重
彭博社报道中的另一个关键信息:智谱表示今晚将放出 Ox Alpha 的权重。对照 GLM-5.3 的节奏(8 月 14 日发布,权重承诺两周后放出,约 8 月 28 日),Ox Alpha 从官方确认到开源只隔数小时。权重上线后,所有人都可以在本地验证它与 GLM 系列的血缘,跑分争议也随之进入可复现阶段。
来源
- Bloomberg:China's Z.AI Made Ox Alpha Stealth Model That Rivals DeepSeek(2026-08-26)
- OpenRouter Rankings,数据截至 2026-08-25
- OpenRouter Ox Alpha 模型页
- 量子位《匿名牛来大模型被扒出智谱血缘》(2026-08,社区指纹细节汇总)
- 新浪财经《牛来大模型 Ox Alpha 屠榜全球 AI 圈》(Kingbench 数据、反方评价)