腾讯混元发布了新一代旗舰模型 Hy4 preview,主打一个「preview」:770B 总参数的 MoE 架构,每个 token 只激活 490 亿参数,上下文窗口拉到 100 万 token,权重按 Apache 2.0 协议在 Hugging Face 全量放出(131 个 safetensors 分片,含 1 个原生 MTP 投机解码层)。腾讯云 TokenHub 和 OpenRouter 已同步上线。
这是混元第一次把「开源第一梯队」的声明写进旗舰发布:官方组织的盲测中,163 名内部专家对 203 个真实工程任务打分,Hy4 preview 均分 2.99(满分 4),略高于 GLM-5.3 的 2.92 和 Kimi K3 的 2.94。

架构:站在 DeepSeek 和 GLM 肩上的 MoE
模型核心规格如下(不含 MTP 层):
| 属性 | 数值 |
|---|---|
| 总参数量 | 770B |
| 每 token 激活 | 49B |
| 层数 | 78(首层稠密 FFN,其余 77 层 MoE) |
| 专家配置 | 256 个路由专家 + 1 个共享专家,每 token 激活 top-8 |
| 注意力 | Gated DSA(DeepSeek 稀疏注意力门控版),64 头 |
| 稀疏索引 | IndexCache 跨层复用,indexer top-k = 2048 |
| 残差结构 | iHC(identity Hyper-Connections),4 条残差流 |
| 上下文长度 | 1M |
| 词表 | 120832 |
激活率只有 6.4%(49B/770B),属于典型的「大容量、小激活」MoE 设计。注意力模块官方明确说灵感来自 DeepSeek 和 GLM:Gated DSA 负责把长上下文的注意力计算压下来,IndexCache 让稀疏索引跨层复用,iHC 用四条残差流扩大层间信息流动。MTP 层(10B 总参、0.7B 激活)独立于主干,专门服务投机解码。
这套组合的目标很直接:1M 上下文 + agentic 长任务下把推理成本压到可用区间。
盲测赢了,但赢在「生产力」而非「跑分」
163 名专家盲测 203 个工程任务,这个评测和传统 benchmark 的区别在于任务来自腾讯内部软工、游戏、金融、安全团队的真实工作流,评分人不知道答案来自哪个模型。结果:
- vs GLM-5.3(2.92):Hy4 preview 胜 46.8% / 平 12.8% / 负 40.4%
- vs Kimi K3(2.94):胜 51.2% / 平 7.9% / 负 40.9%
胜率刚过半,属于「同一梯队的位次之争」,谈不上代差。官方在附录里给出的大规模 benchmark 数据,格局也类似。下面是从 Benchmark Appendix 摘出的代表性对比(部分官方数值有两种评测设置的结果,此处取第一个;带星号口径的完整数据见官方附录图):
| 基准 | Hy4 preview | GLM-5.3 | Kimi K3 | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 85.4 | 88.2 | 88.3 | 88.8 | 86.7 |
| SWE-bench Pro | 65.7 | 64.6 | 63.3 | 64.6 | 79.2 |
| SWE-bench Multilingual | 82.9 | 81.3 | 80.8 | 74.1 | 89.5 |
| DeepSWE | 64.3 | 66.9 | 67.5 | 72.7 | 68.8 |
| OneMillionBench (with tools) | 65.4 | 64.5 | 63.5 | 67.1 | 68.1 |
| Toolathlon-Verified | 74.1 | 73.0 | 76.5 | 73.2 | 76.5 |
| APEX-Agents (pass@1) | 37.1 | 38.1 | 41.0 | 39.9 | 41.8 |
| GDPval-AA V2 (Elo) | 1678 | 1763 | 1675 | 1711 | 1831 |
| GPQA Diamond | 92.3 | 91.7 | 93.5 | 94.1 | 93.7 |
| HLE (no tools, text-only) | 43.4 | 42.3 | 46.9 | 49.5 | 54.9 |
| MathArena Apex 2025 | 74.2 | 无数据 | 68.4 | 90.0 | 91.4 |
| CritPt (official) | 16.9 | 19.1 | 23.4 | 32.3 | 29.1 |

三个观察:
开源四强已经互相咬死。 Hy4 preview、GLM-5.3、Kimi K3、DeepSeek V4 在绝大多数 agentic 基准上的差距在 2 个点以内,第一名轮流坐。终端任务(Terminal-Bench)上四家全部挤在 85-88 区间。
对标闭源旗舰仍有可见差距,集中在硬推理。 Claude Opus 5 在 SWE-bench Pro 上领先 Hy4 preview 约 13.5 个点,NL2Repo-Bench 领先 16 个点;GPT-5.6 Sol 在数学类基准上优势更明显(MathArena 90.0 vs 74.2,CritPt 32.3 vs 16.9)。Hy4 preview 官方也承认这是早期版本,预训练和后训练都还有较大空间。
办公分析是主攻方向且确实有料。 在腾讯自建的 E-Bench、E-Bench-Code 等办公/工程分析基准上,Hy4 preview 拿到 77-79 分,反超 GLM-5.3(66-71)和 Kimi K3(74-78),距 GPT-5.6 Sol 只差 2-4 个点。结合它跟 CodeBuddy、WorkBuddy 的产品协同,「为生产力而生」的定位在数据上是自洽的。
AI4Science:这次发布里最不一样的部分
Hy4 preview 单独列了一批科研战果,其中最扎眼的是数学:
三维 Blaschke–Lebesgue 问题。这个问题问的是:三维空间里,能从任意方向「罩住」单位圆盘的立体形状,最小体积能做多大。从 1914 年被提出至今,数学家连最优形状长什么样都没有证明。Hy4 preview 配合 Hyra 系统把已知体积下界从 0.380799 推进到 0.41104;对照 Meissner 四面体猜想给出的 0.41986,剩下的差距只有约 2%。完整证明已放在 GitHub(Tencent-Hunyuan/Hyra-results 仓库)。
其他两项:
- 凝聚态物理:低温量子输运器件设计任务中,模型自主完成量子散射求解器构建、五势垒结构优化和独立验证,把高能阻带平均泄漏率从 48.2% 降到 4.8%;
- 分子动力学:配合 Hyra,32,512 原子磷脂双分子层 SO3LR 模拟在 JAX 实现上再提速 2.0 倍,达到 54.9 ms/step,单张高端 GPU 可容纳 30 万原子。
还有一个容易被忽略的细节:官方让模型自主分析自家推理系统的瓶颈,围绕算子融合、通信优化做了多轮优化,端到端吞吐提升 31.8%。模型优化自己的推理基础设施,这种「自我改进」叙事通常出现在闭源实验室的发布里。
可用性与已知问题
开源头链覆盖 Hugging Face、GitHub、ModelScope、GitCode,协议 Apache 2.0,允许商用。体验入口在腾讯云 AI Studio、OpenRouter,以及元宝、ima、CodeBuddy、WorkBuddy 等腾讯系产品。
官方在发布文里主动列了已知问题:复杂任务上思考时间偏长、有过度自我验证倾向,正式版 Hy4 会基于 preview 收集的真实反馈继续迭代。这个姿态和 Hy3 preview 时期一致:先发早期版本换真实使用数据。
对开发者来说,这次发布最实际的意义是多了一个 Apache 2.0、1M 上下文、激活仅 49B 的旗舰级选择,国内开源第一梯队从「三强」变成了「四强」,而位次每隔几个月就会重排一次。
来源:腾讯混元官方发布 | Hugging Face | 公众号发布文