千问首次开源Max级权重:Qwen3.8-2.4T-A95B架构与benchmark解读

Qwen 首次开源 Max 级权重

千问团队在 HuggingFace 上发布了 Qwen3.8-2.4T-A95B 的完整模型权重。这是 Qwen 系列第一次将 Max 级旗舰模型以开放权重形式释出。此前 Qwen3.5 和 Qwen3.6 系列虽然广泛开源,但 Max 级旗舰始终只通过 API 提供。

Qwen3.8-2.4T-A95B

开源仓库包含完整的 Transformers 格式权重和配置文件,兼容 vLLM、SGLang、TokenSpeed 等主流推理框架。许可证为 Qwen 自定义协议(qwen3.8-max)。

模型架构

Qwen3.8-2.4T-A95B 的架构在几个关键维度上做了不同于常规 MoE 的设计。

参数数值
总参数量2.4T
激活参数量95B
激活比例约 4%
隐藏维度8192
Token Embedding248,320(Padded)
层数92
专家总数512
激活专家数10 路由 + 1 共享
专家中间维度2048
原生上下文262,144 tokens
可扩展上下文1,010,000 tokens

混合注意力:DeltaNet + Standard Attention

92 层按照 4 层一组的模式组织,每组内部:

  • 第 1-3 层:Gated DeltaNet(线性注意力),V 使用 128 个头,QK 使用 16 个头,头维度 128
  • 第 4 层:Gated Attention(标准注意力),Q 使用 64 个头,KV 使用 4 个头,头维度 256,RoPE 维度 64

共 23 组循环。这种"3:1 线性注意力与标准注意力交替"的设计,目的是在长序列处理中降低前 3 层的计算开销(线性注意力不随序列长度二次增长),同时保留第 4 层的完整注意力能力。

MoE 结构

专家池共 512 个,每个 token 激活 10 个路由专家加 1 个共享专家,专家中间维度 2048。4% 的激活比例意味着推理时的实际计算量接近 95B 稠密模型,而知识容量由 2.4T 总参数承载。

多 Token 预测(MTP)

模型训练时采用了多 Token 预测(Multi-Token Prediction),即每一步预测多个未来 token 而非单 token 自回归。推理时可利用 MTP 做投机解码加速。

Benchmark 对比

以下是 Qwen3.8-Max 与几个对标模型的厂商自测成绩(所有数据来自 Qwen 官方 model card):

编程 Agent

BenchmarkOpus 4.8Fable 5GPT-5.6 Sol (max)Qwen3.7-MaxQwen3.8-Max
Terminal Bench 2.184.684.688.874.586.6
SWE-bench Pro69.280.064.660.667.7
DeepSWE 1.159.070.073.021.656.6
FrontierSWE70.088.8--40.773.5
PaperBench80.388.890.564.893.0

专业工作与长程任务

BenchmarkOpus 4.8Fable 5GPT-5.6 Sol (max)Qwen3.7-MaxQwen3.8-Max
CoWorkBench62.368.170.452.474.8
SkillsBench76.384.182.955.078.0
WideSearch81.082.682.275.581.9

PaperBench 93.0 是目前公开成绩中的最高分,超过 GPT-5.6 Sol 的 90.5 和 Claude Fable 5 的 88.8。CoWorkBench 74.8 同样领先。但在 SWE-bench Pro(67.7 vs Fable 5 的 80.0)和 DeepSWE 1.1(56.6 vs Fable 5 的 70.0)上,与前沿闭源模型差距明显。

以上均为厂商自测成绩。benchmark 页脚注明,Fable 5 的部分结果可能涉及 fallback 机制,不同 benchmark 使用的 harness 和评测参数(温度、超时、上下文窗口)各不相同,跨模型直接对比时需谨慎。

开源权重版与 API 版的区别

HuggingFace 上的 Qwen3.8-2.4T-A95B 和 Qwen Cloud 上的 Qwen3.8-Max 之间存在功能差异:

特性开源权重版API 版(Qwen3.8-Max)
模态纯文本文本 + 视觉输入
Thinking 模式强制开启,不可关闭可开关
上下文长度262K(可外推至 1.01M)1M(默认)
reasoning_effort支持 xhigh/medium/low支持
preserve_thinking默认开启默认开启
官方工具集成内置

开源权重版每次响应都会以 <think>\n...\n</think> 格式输出推理过程,然后才是最终答案。开发者需要解析这两个部分。

部署方式

推荐采样参数:temperature=1.0, top_p=0.95, top_k=20, min_p=0.0

推理框架支持:

通过 Qwen Cloud API 调用示例:

python
from openai import OpenAI

client = OpenAI(
    base_url="your-base-url",
    api_key="your-api-key"
)

completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-2.4T-A95B",
    messages=[{"role": "user", "content": "Write a function to merge sorted linked lists."}],
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,
            "preserve_thinking": True,
        }
    },
    reasoning_effort="xhigh",
    stream=True,
)

for chunk in completion:
    if chunk.choices:
        delta = chunk.choices[0].delta
        if hasattr(delta, "reasoning_content") and delta.reasoning_content:
            print(delta.reasoning_content, end="", flush=True)
        if delta.content:
            print(delta.content, end="", flush=True)

对于生产部署,官方建议将推理内容最大输出长度设为 262,144 tokens,最终响应最大输出长度设为 131,072 tokens,以充分利用 1M 上下文窗口。


来源