Qwen 首次开源 Max 级权重
千问团队在 HuggingFace 上发布了 Qwen3.8-2.4T-A95B 的完整模型权重。这是 Qwen 系列第一次将 Max 级旗舰模型以开放权重形式释出。此前 Qwen3.5 和 Qwen3.6 系列虽然广泛开源,但 Max 级旗舰始终只通过 API 提供。

开源仓库包含完整的 Transformers 格式权重和配置文件,兼容 vLLM、SGLang、TokenSpeed 等主流推理框架。许可证为 Qwen 自定义协议(qwen3.8-max)。
模型架构
Qwen3.8-2.4T-A95B 的架构在几个关键维度上做了不同于常规 MoE 的设计。
| 参数 | 数值 |
|---|---|
| 总参数量 | 2.4T |
| 激活参数量 | 95B |
| 激活比例 | 约 4% |
| 隐藏维度 | 8192 |
| Token Embedding | 248,320(Padded) |
| 层数 | 92 |
| 专家总数 | 512 |
| 激活专家数 | 10 路由 + 1 共享 |
| 专家中间维度 | 2048 |
| 原生上下文 | 262,144 tokens |
| 可扩展上下文 | 1,010,000 tokens |
混合注意力:DeltaNet + Standard Attention
92 层按照 4 层一组的模式组织,每组内部:
- 第 1-3 层:Gated DeltaNet(线性注意力),V 使用 128 个头,QK 使用 16 个头,头维度 128
- 第 4 层:Gated Attention(标准注意力),Q 使用 64 个头,KV 使用 4 个头,头维度 256,RoPE 维度 64
共 23 组循环。这种"3:1 线性注意力与标准注意力交替"的设计,目的是在长序列处理中降低前 3 层的计算开销(线性注意力不随序列长度二次增长),同时保留第 4 层的完整注意力能力。
MoE 结构
专家池共 512 个,每个 token 激活 10 个路由专家加 1 个共享专家,专家中间维度 2048。4% 的激活比例意味着推理时的实际计算量接近 95B 稠密模型,而知识容量由 2.4T 总参数承载。
多 Token 预测(MTP)
模型训练时采用了多 Token 预测(Multi-Token Prediction),即每一步预测多个未来 token 而非单 token 自回归。推理时可利用 MTP 做投机解码加速。
Benchmark 对比
以下是 Qwen3.8-Max 与几个对标模型的厂商自测成绩(所有数据来自 Qwen 官方 model card):
编程 Agent
| Benchmark | Opus 4.8 | Fable 5 | GPT-5.6 Sol (max) | Qwen3.7-Max | Qwen3.8-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 74.5 | 86.6 |
| SWE-bench Pro | 69.2 | 80.0 | 64.6 | 60.6 | 67.7 |
| DeepSWE 1.1 | 59.0 | 70.0 | 73.0 | 21.6 | 56.6 |
| FrontierSWE | 70.0 | 88.8 | -- | 40.7 | 73.5 |
| PaperBench | 80.3 | 88.8 | 90.5 | 64.8 | 93.0 |
专业工作与长程任务
| Benchmark | Opus 4.8 | Fable 5 | GPT-5.6 Sol (max) | Qwen3.7-Max | Qwen3.8-Max |
|---|---|---|---|---|---|
| CoWorkBench | 62.3 | 68.1 | 70.4 | 52.4 | 74.8 |
| SkillsBench | 76.3 | 84.1 | 82.9 | 55.0 | 78.0 |
| WideSearch | 81.0 | 82.6 | 82.2 | 75.5 | 81.9 |
PaperBench 93.0 是目前公开成绩中的最高分,超过 GPT-5.6 Sol 的 90.5 和 Claude Fable 5 的 88.8。CoWorkBench 74.8 同样领先。但在 SWE-bench Pro(67.7 vs Fable 5 的 80.0)和 DeepSWE 1.1(56.6 vs Fable 5 的 70.0)上,与前沿闭源模型差距明显。
以上均为厂商自测成绩。benchmark 页脚注明,Fable 5 的部分结果可能涉及 fallback 机制,不同 benchmark 使用的 harness 和评测参数(温度、超时、上下文窗口)各不相同,跨模型直接对比时需谨慎。
开源权重版与 API 版的区别
HuggingFace 上的 Qwen3.8-2.4T-A95B 和 Qwen Cloud 上的 Qwen3.8-Max 之间存在功能差异:
| 特性 | 开源权重版 | API 版(Qwen3.8-Max) |
|---|---|---|
| 模态 | 纯文本 | 文本 + 视觉输入 |
| Thinking 模式 | 强制开启,不可关闭 | 可开关 |
| 上下文长度 | 262K(可外推至 1.01M) | 1M(默认) |
| reasoning_effort | 支持 xhigh/medium/low | 支持 |
| preserve_thinking | 默认开启 | 默认开启 |
| 官方工具集成 | 无 | 内置 |
开源权重版每次响应都会以 <think>\n...\n</think> 格式输出推理过程,然后才是最终答案。开发者需要解析这两个部分。
部署方式
推荐采样参数:temperature=1.0, top_p=0.95, top_k=20, min_p=0.0。
推理框架支持:
- SGLang — Qwen3.8 Cookbook
- vLLM — Qwen3.8 Recipe
- TokenSpeed — Qwen3.8 Recipe
通过 Qwen Cloud API 调用示例:
from openai import OpenAI
client = OpenAI(
base_url="your-base-url",
api_key="your-api-key"
)
completion = client.chat.completions.create(
model="Qwen/Qwen3.8-2.4T-A95B",
messages=[{"role": "user", "content": "Write a function to merge sorted linked lists."}],
extra_body={
"chat_template_kwargs": {
"enable_thinking": True,
"preserve_thinking": True,
}
},
reasoning_effort="xhigh",
stream=True,
)
for chunk in completion:
if chunk.choices:
delta = chunk.choices[0].delta
if hasattr(delta, "reasoning_content") and delta.reasoning_content:
print(delta.reasoning_content, end="", flush=True)
if delta.content:
print(delta.content, end="", flush=True)对于生产部署,官方建议将推理内容最大输出长度设为 262,144 tokens,最终响应最大输出长度设为 131,072 tokens,以充分利用 1M 上下文窗口。
来源