Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺

Qwen 3.8 神经网络可视化

7 月 19 日,阿里巴巴通义千问(Qwen)团队在 X 平台发布 Qwen3.8,宣称参数规模达到 2.4 万亿(2.4T),并承诺将开放权重(open-weight)。这是 Qwen 家族首次有模型突破万亿参数门槛并具备原生多模态能力。Qwen 团队将其定位为"仅次于 Anthropic Fable 5 的最强模型"。

Qwen3.8-Max-Preview 已在 Alibaba 的 Token Plan、Qoder 和 QoderWork 平台同步上线,开发者可通过订阅制抢先体验。

2.4T 参数意味着什么

Qwen3.8 的 2.4T 参数量是目前开源社区能接触到的最大规模模型之一。作为参照:前代 Qwen3.7-Max 约 1T 参数,Moonshot Kimi K3 约 1T,Meta Llama 4 旗舰约 400B。这意味着 Qwen3.8 的参数量是 Qwen3.7 的 2.4 倍。

Qwen 团队负责人 Shuai Bai 在 X 平台补充了关键细节:Qwen3.8 是团队首个参数量超过 1T 的多模态模型,可以处理图像、视频和文档——此前 Qwen3.7-Max 仅支持纯文本。这一跨越使 Qwen3.8 在视觉理解和跨模态推理上首次与 Claude Fable 5、GPT-5.6 处于同一竞争维度。

2.4T 参数量的工程挑战在于推理效率。开源社区目前没有能在单机上运行 2.4T 参数模型的消费级方案——即便用 INT4 量化,显存需求也在 1TB 以上。Qwen 团队将 3.8-Max-Preview 托管在云端 API,意味着短期内本地部署不现实,开发者的实际使用将依赖 Alibaba Cloud 的算力。

开放权重承诺与历史验证

Qwen3.8 发布声明中最受关注的一句话是"going open-weight soon"。但这句话的可信度需要放在 Qwen 近期发布历史的脉络中评估。

版本发布时间参数规模权重状态验证
Qwen3-Max-Preview2025-091T+闭源✅ 已验证
Qwen3.6-Max-Preview2026-04~1T sparse MoE闭源✅ 已验证
Qwen3.7-Max2026-051M 上下文 MoE闭源✅ 已验证
Qwen3.82026-072.4T(宣称)开源(承诺)❌ 待验证

Qwen 模型谱系

最近三款旗舰模型(Qwen3-Max、3.6-Max、3.7-Max)均未开放权重,仅提供 API 访问。这标志着 Alibaba 采用了与 OpenAI、Anthropic 类似的分层策略——早期全面开源,旗舰闭源:研究模型和小参数模型开放权重(如 Qwen3.6-27B、Qwen3.6-35B-A3B),商业旗舰闭源。

Qwen3.8 承诺开放权重,如果兑现,将是自 2025 年 9 月 Qwen3-Max 发布以来首个开放权重的旗舰模型。这对开源社区意义重大:2.4T 参数的开放权重模型将为研究机构和企业提供自部署的前沿能力,无需依赖 API 供应商。

Token Plan 定价模型

Qwen3.8-Max-Preview 通过 Alibaba 的 Token Plan 订阅制提供访问。Token Plan 是一个多模型订阅平台,同一订阅可调用多款前沿模型。

层级发布价原价每周额度5 小时爆发
Lite$6/月$82,500700
Standard$18/月$2510,0003,000
Pro$68/月$8040,00012,000

订阅覆盖的模型包括 Qwen3.7-Max、Qwen3.8-Max-Preview(新增)、GLM-5.2、DeepSeek-V4-Pro、Wan2.7-Image-Pro。Qwen 团队表示 Preview 阶段的定价为标准价格的 10%。

参照前代 Qwen3.7-Max 的按量计费($1.25/百万输入 token、$3.75/百万输出 token),Qwen 的旗舰模型定价显著低于 Claude Fable 5($10/$50)和 Kimi K3($3/$15)。Token Plan 的订阅制进一步降低了重度用户的边际成本——Pro 层 40,000 周度额度按 Qwen3.7-Max 的输入价格折算约 $50/周,订阅费 $68/月明显有补贴成分。

竞争格局:截击 Kimi K3

Qwen3.8 发布的时机经过精确计算。一周前,Moonshot AI 的 Kimi K3 模型在 DeepSWE v1.1 编码基准测试中跻身前三,引发了广泛关注,但 Kimi K3 的权重至今未开放,用户只能通过 API 使用。Moonshot 在 6 月达到 $3 亿年化收入后,正计划 6 个月内 IPO。

Qwen3.8 的"开放权重"承诺直接对标 Kimi K3 的"承诺但未兑现"策略。对于正在评估中国 AI 供应商的开发者来说,两个模型都宣传开放但都尚未放出权重,Qwen3.8 的参数量(2.4T vs 1T)在数字上占据优势。

Qwen Logo

但参数量并非全部。Qwen3.6-27B 曾在 SWE-bench Verified 上以 77.2% 击败 397B 参数的 MoE 模型,证明训练质量和架构设计比参数总量更重要。Qwen3.8 的实际竞争力取决于尚未公开的基准测试数据。

尚无公开基准数据

Qwen 团队在发布时未附带任何基准测试结果。Qwen 官方声称 Qwen3.8"优于 Qwen3.7-Max,尤其在编码和复杂生产力任务上",具体包括全栈开发、数据分析和办公工作流。

参照 Qwen3.7-Max 的已知成绩可以推断 Qwen3.8 需要达到的基线:

基准Qwen3.7-MaxFable 5Kimi K3
SWE-bench Verified~80%95%~81%
GPQA~68%~73%~70%

"仅次于 Fable 5"这个定位在推理类基准上具有可信度——Qwen3.7-Max 的 GPQA 成绩距全球最优仅差 2 分。但在 SWE-bench Verified 编码基准上,Fable 5 以 95% 领先近 15 分,本月 Kimi K3、Inkling、MiniMax M3 均尝试追赶但都未成功。Qwen3.8 能否在一代之内填补这个差距,需要等待官方发布完整评测数据。

Token Plan 中的模型矩阵

Qwen3.8-Max-Preview 在 Token Plan 中与其他前沿模型并列。这对开发者的模型选择有直接影响:同一个 $18/月 Standard 订阅现在可以调用 Qwen3.8-Max-Preview、GLM-5.2 和 DeepSeek-V4-Pro 三款中国顶级模型,外加图像生成模型 Wan2.7-Image-Pro。

这种多模型捆绑策略是 Alibaba 独有的——OpenAI 和 Anthropic 的订阅制只包含自家模型。Token Plan 的定位是一个订阅覆盖中国主要 AI 实验室的全部旗舰,这对预算有限的开发团队有实际吸引力。

开发者视角

从 Qwen3.7-Max 的已知特性可以推测 Qwen3.8 的体验方向。Qwen3.7-Max 支持 100 万 token 上下文窗口,具备 agent 能力(工具调用、多步推理),在 agentic 编码、数据分析、办公自动化场景中有优化。Qwen3.8 在此基础上增加了多模态——图像、视频、文档理解——使其能处理 UI 截图分析、PDF 信息提取等纯文本模型无法完成的任务。

Unsloth AI 在 Qwen 发布推文下回复,暗示社区已经开始准备 Qwen3.8 权重发布后的量化适配工作。Unsloth 的工具链此前已支持 Qwen3.6-27B 的 GGUF 量化,如果 Qwen3.8 开放权重,量化版本可能在权重发布后数天内出现。

开放权重的时间线风险

"开放权重即将推出"(open-weight soon)是 Qwen3.8 发布中风险最高的承诺。参考 Kimi K3 的先例:Moonshot 在 7 月 16 日开放 API 并宣布"权重即将发布",但截至本文发布时(7 月 20 日)权重仍未放出,实际延迟可能达数周。Moonshot 自身的公开承认是"整体仍落后 CF5 和 GPT-5.6 Sol"。

Qwen3.8 的情况类似——API 和 Preview 已可用,但权重"soon"是一个模糊的时间承诺。Alibaba 最近三款旗舰均未开放权重的历史记录降低了这一承诺的可信度。对需要本地部署的开发者来说,等待权重释放期间不应将生产负载迁移到 Qwen3.8。

对开源生态的影响

如果 Qwen3.8 开放权重,2.4T 参数的模型将对开源社区产生连锁影响。当前最大的开放权重模型是 Qwen3.6 系列(27B-480B)和 DeepSeek V3/V4(671B-1T)。2.4T 的开放权重意味着研究机构可以首次在本地复现前沿多模态能力,企业可以在自有基础设施上部署顶级模型而无需数据出境。

这也是中国 AI 公司在开源策略上的一次重要回归。2026 年上半年,Alibaba、Moonshot、DeepSeek 等主要玩家纷纷转向闭源旗舰 + 开源小模型的分层策略,引发了对"开源是否已死"的讨论。Qwen3.8 如果兑现开放权重承诺,将在一定程度上扭转这一趋势。

对于正在评估模型的开发者来说,Qwen3.8-Max-Preview 已经可以通过 Token Plan 测试,建议在官方发布基准数据和开放权重之前,用自己的工作负载做独立评测——在任何模型上,你自己的评测结果比厂商声称的排名更可靠。

推荐阅读