腾讯混元 Hy4 preview 技术解读:770B MoE 开源旗舰,盲测小胜 GLM-5.3 与 Kimi K3

腾讯混元发布了新一代旗舰模型 Hy4 preview,主打一个「preview」:770B 总参数的 MoE 架构,每个 token 只激活 490 亿参数,上下文窗口拉到 100 万 token,权重按 Apache 2.0 协议在 Hugging Face 全量放出(131 个 safetensors 分片,含 1 个原生 MTP 投机解码层)。腾讯云 TokenHub 和 OpenRouter 已同步上线。

这是混元第一次把「开源第一梯队」的声明写进旗舰发布:官方组织的盲测中,163 名内部专家对 203 个真实工程任务打分,Hy4 preview 均分 2.99(满分 4),略高于 GLM-5.3 的 2.92 和 Kimi K3 的 2.94。

Hy4 preview 官方评测总览

架构:站在 DeepSeek 和 GLM 肩上的 MoE

模型核心规格如下(不含 MTP 层):

属性数值
总参数量770B
每 token 激活49B
层数78(首层稠密 FFN,其余 77 层 MoE)
专家配置256 个路由专家 + 1 个共享专家,每 token 激活 top-8
注意力Gated DSA(DeepSeek 稀疏注意力门控版),64 头
稀疏索引IndexCache 跨层复用,indexer top-k = 2048
残差结构iHC(identity Hyper-Connections),4 条残差流
上下文长度1M
词表120832

激活率只有 6.4%(49B/770B),属于典型的「大容量、小激活」MoE 设计。注意力模块官方明确说灵感来自 DeepSeek 和 GLM:Gated DSA 负责把长上下文的注意力计算压下来,IndexCache 让稀疏索引跨层复用,iHC 用四条残差流扩大层间信息流动。MTP 层(10B 总参、0.7B 激活)独立于主干,专门服务投机解码。

这套组合的目标很直接:1M 上下文 + agentic 长任务下把推理成本压到可用区间。

盲测赢了,但赢在「生产力」而非「跑分」

163 名专家盲测 203 个工程任务,这个评测和传统 benchmark 的区别在于任务来自腾讯内部软工、游戏、金融、安全团队的真实工作流,评分人不知道答案来自哪个模型。结果:

  • vs GLM-5.3(2.92):Hy4 preview 胜 46.8% / 平 12.8% / 负 40.4%
  • vs Kimi K3(2.94):胜 51.2% / 平 7.9% / 负 40.9%

胜率刚过半,属于「同一梯队的位次之争」,谈不上代差。官方在附录里给出的大规模 benchmark 数据,格局也类似。下面是从 Benchmark Appendix 摘出的代表性对比(部分官方数值有两种评测设置的结果,此处取第一个;带星号口径的完整数据见官方附录图):

基准Hy4 previewGLM-5.3Kimi K3GPT-5.6 SolClaude Opus 5
Terminal-Bench 2.185.488.288.388.886.7
SWE-bench Pro65.764.663.364.679.2
SWE-bench Multilingual82.981.380.874.189.5
DeepSWE64.366.967.572.768.8
OneMillionBench (with tools)65.464.563.567.168.1
Toolathlon-Verified74.173.076.573.276.5
APEX-Agents (pass@1)37.138.141.039.941.8
GDPval-AA V2 (Elo)16781763167517111831
GPQA Diamond92.391.793.594.193.7
HLE (no tools, text-only)43.442.346.949.554.9
MathArena Apex 202574.2无数据68.490.091.4
CritPt (official)16.919.123.432.329.1

Hy4 preview Benchmark Appendix 完整数据表

三个观察:

开源四强已经互相咬死。 Hy4 preview、GLM-5.3、Kimi K3、DeepSeek V4 在绝大多数 agentic 基准上的差距在 2 个点以内,第一名轮流坐。终端任务(Terminal-Bench)上四家全部挤在 85-88 区间。

对标闭源旗舰仍有可见差距,集中在硬推理。 Claude Opus 5 在 SWE-bench Pro 上领先 Hy4 preview 约 13.5 个点,NL2Repo-Bench 领先 16 个点;GPT-5.6 Sol 在数学类基准上优势更明显(MathArena 90.0 vs 74.2,CritPt 32.3 vs 16.9)。Hy4 preview 官方也承认这是早期版本,预训练和后训练都还有较大空间。

办公分析是主攻方向且确实有料。 在腾讯自建的 E-Bench、E-Bench-Code 等办公/工程分析基准上,Hy4 preview 拿到 77-79 分,反超 GLM-5.3(66-71)和 Kimi K3(74-78),距 GPT-5.6 Sol 只差 2-4 个点。结合它跟 CodeBuddy、WorkBuddy 的产品协同,「为生产力而生」的定位在数据上是自洽的。

AI4Science:这次发布里最不一样的部分

Hy4 preview 单独列了一批科研战果,其中最扎眼的是数学:

三维 Blaschke–Lebesgue 问题。这个问题问的是:三维空间里,能从任意方向「罩住」单位圆盘的立体形状,最小体积能做多大。从 1914 年被提出至今,数学家连最优形状长什么样都没有证明。Hy4 preview 配合 Hyra 系统把已知体积下界从 0.380799 推进到 0.41104;对照 Meissner 四面体猜想给出的 0.41986,剩下的差距只有约 2%。完整证明已放在 GitHub(Tencent-Hunyuan/Hyra-results 仓库)。

其他两项:

  • 凝聚态物理:低温量子输运器件设计任务中,模型自主完成量子散射求解器构建、五势垒结构优化和独立验证,把高能阻带平均泄漏率从 48.2% 降到 4.8%;
  • 分子动力学:配合 Hyra,32,512 原子磷脂双分子层 SO3LR 模拟在 JAX 实现上再提速 2.0 倍,达到 54.9 ms/step,单张高端 GPU 可容纳 30 万原子。

还有一个容易被忽略的细节:官方让模型自主分析自家推理系统的瓶颈,围绕算子融合、通信优化做了多轮优化,端到端吞吐提升 31.8%。模型优化自己的推理基础设施,这种「自我改进」叙事通常出现在闭源实验室的发布里。

可用性与已知问题

开源头链覆盖 Hugging Face、GitHub、ModelScope、GitCode,协议 Apache 2.0,允许商用。体验入口在腾讯云 AI Studio、OpenRouter,以及元宝、ima、CodeBuddy、WorkBuddy 等腾讯系产品。

官方在发布文里主动列了已知问题:复杂任务上思考时间偏长、有过度自我验证倾向,正式版 Hy4 会基于 preview 收集的真实反馈继续迭代。这个姿态和 Hy3 preview 时期一致:先发早期版本换真实使用数据。

对开发者来说,这次发布最实际的意义是多了一个 Apache 2.0、1M 上下文、激活仅 49B 的旗舰级选择,国内开源第一梯队从「三强」变成了「四强」,而位次每隔几个月就会重排一次。

来源:腾讯混元官方发布 | Hugging Face | 公众号发布文