Qwen3.8-Max 的发布重点落在长程任务。Qwen 官方将它定义为 Qwen-Max 系列首次开放权重的模型,参数规模为 2.4 万亿,激活参数 950 亿,基于 Qwen3.5 的架构基础构建,现已通过 QwenCloud 提供 API。官方公告还列出了 Hugging Face 和 ModelScope 的权重发布安排。
这组信息的技术含义,可以从模型规模、智能体工作流和训练反馈三个层面理解。Qwen3.8-Max 的展示重点并不局限于一次问答的准确率,官方案例覆盖了多天自动编程、论文实验复现、在线竞赛、量化研究、芯片设计和多模态应用重建。它要解决的工程问题,是让模型在长链路任务中持续保留目标、执行工具、读取结果、修正方案,并把中间结果推进到可交付状态。
先看公开性能表
Qwen 官方给出了覆盖编码智能体、通用智能体、通用能力和多模态能力的完整表格。下面挑选与开发者工作最相关的项目,数值均来自官方表格:
| 评测项目 | Opus4.8 | Fable5 | GPT5.6 Sol | Qwen3.7-Max | Qwen3.8-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 74.5 | 86.6 |
| SWE-bench Pro | 69.2 | 80.0 | 64.6 | 60.6 | 67.7 |
| PaperBench | 80.3 | 88.8 | 90.5 | 64.8 | 93.0 |
| CoWorkBench | 72.3 | 75.9 | 71.5 | 64.6 | 74.8 |
| OSWorld-Verified | 83.4 | 85.0 | 83.2 | 73.3 | 86.1 |
| OmniDocBench 1.5 | 86.5 | 89.5 | 86.7 | 91.4 | 92.1 |
| VideoMME(含字幕) | 85.4 | -- | 89.5 | 88.0 | 90.4 |
| LogicVista | 76.7 | 85.7 | 89.7 | 84.3 | 91.9 |
这张表有两个阅读角度。第一,编码与办公任务的分数并不沿着同一条能力轴排列,Terminal Bench、PaperBench、OSWorld-Verified 分别对应终端操作、科研复现和图形界面任务。第二,Qwen3.8-Max 的技术展示并没有把性能表和工作流案例分开,后者给出了模型如何得到这些结果的过程记录。
反馈闭环:让智能体持续工作
Qwen 官方展示的第一个长程案例是 oh-my-cli。模型从空目录开始创建项目,并在十天级的自主运行中构建一套自进化 harness。这个 harness 将用户反馈、社区实践和模型自测结果纳入同一个工程循环。
它的任务状态包含 ready、leased 和 active。新需求进入 GitHub Issues 后,agent 领取任务,调度器负责派发,监控器和 watchdog 负责观察执行状态。代码完成后,系统触发 Build、Unit Test、E2E 和 Desktop Lifecycle 检查;异常会回到对应的 issue 或 PR,修复后再次验证。
可以把这类系统抽象成下面的执行循环:
需求进入 Issue
-> 状态机领取任务
-> Agent 修改代码
-> Build / Unit Test / E2E / Desktop 检查
-> 失败:回到 Issue 继续修复
-> 成功:合并 PR,产生下一轮需求这个结构解决的是长程任务中的状态管理问题。单次生成只需要返回文本,持续工程任务还需要记录当前目标、已完成工作、失败原因、待处理事项和下一次恢复位置。状态机负责任务归属,测试负责结果判定,watchdog 负责异常恢复,三者组合后,模型才有机会在长时间运行中维持一个稳定的执行轨迹。
Qwen 官方记录显示,经过约 16 天的 AI 自主运行,oh-my-cli 累计产生 265 次 commits、127 个 PR 和 151 个 issues。这个数字描述的是一个持续运行的工程系统,其中既包含代码生成,也包含需求整理、测试、修复和交付。
论文复现:反馈循环进入科研任务
第二个案例把一篇论文和 GPU 交给模型,要求它复现《Unified Data Selection for LLM Reasoning》的实验,再探索改进方案。论文研究的问题是,在训练预算有限时,怎样从大量数据中挑出更有训练价值的样本,方法关注解题过程中的困难决策点。
Qwen3.8-Max 连续工作约五天,累计约 125 小时,写下约 7600 行代码,执行超过 1100 步操作,完成 33 轮 GPU 训练。第一阶段约 37 小时用于重建数据处理、训练和评测流水线,并复现论文的六项主要结论。论文方法在 AIME24 上相较随机选择高出 7.7%。
随后模型运行自我改进循环,四轮实验共测试 18 种改进想法:
| 阶段 | 方法 | AIME24 | 相对基线 |
|---|---|---|---|
| 基线 | 论文方法复现 | 49.58% | 0 |
| 第一轮 | 按难度拆分数据后选择 | 50.42% | +0.84 |
| 第二轮 | 对熵与得分差值加权 | 51.67% | +2.09 |
| 第三轮 | 调整选择宽度 | 51.25% | +1.67 |
| 第四轮 | 统计困难决策点数量 | 52.29% | +2.71 |
这组结果可以拆成四个可复用模块:论文解析、实验代码生成、GPU 训练执行、结果驱动的下一轮假设。模型每轮都需要读取实验输出,再决定保留哪个方向、修改哪段代码和怎样安排下一次训练。对于科研智能体,工具调用数量并不等于研究质量,关键在于实验结果是否能改变后续行动。
统一奖励系统:让不同任务进入同一训练框架
长程能力需要大量环境。Qwen 官方对真实工作强化学习系统的描述,包含三个组成部分。
第一是可解耦扩展的环境。任务维度可以由单任务扩展到多任务和多天任务,工作区可以由多文件目录扩展到层级文件夹和复杂异构目录,harness 也可以按照类别、版本和技能继续扩展。环境增长后,任务、工作区和 harness 可以组合出大量训练场景。
第二是统一奖励系统。它同时处理执行结果检查、基于评分标准的文本与渲染视觉结果判定,以及 agent 对中间结果的检查。不同任务使用不同验证方式,但奖励系统提供统一接口,让训练过程能够比较不同环境中的结果。
第三是在线数据平衡器。它按照任务、难度、工作区和 harness 调整每个 batch 的分布,降低 batch 之间的梯度方差,使强化学习算力能够保持连续扩展。

官方图中的 Envs 可以理解为环境步骤。曲线在训练环境规模扩大后持续上升,图中还标出了最佳 checkpoint。对于智能体训练,这种曲线比单一静态榜单更能说明训练系统的反馈结构:模型获得的能力来自任务环境、结果判定和数据分布共同构成的循环。
Dynamic Workflows:把计划变成可执行程序
在量化研究案例中,Qwen3.8-Max 根据一行任务描述构建 ETF 轮动策略研究流程,自动搭建数据系统、基础因子和多轮迭代过程。它会读取回测结果,处理设计期与验证期指标不一致的情况,删除冗余因子,并为多条路径加入多种种子验证。
在并行因子挖掘环节,模型从动量、价值、质量、投资、低波动和情绪六类因子描述出发,每类拆分为 50 个研究方向,调度约 330 个子 agent,完成约 6000 次回测。官方案例报告的入选因子超额 Sharpe 比率为 0.64 至 1.48,IC 为 0.010 至 0.014。
这里的重点在工作流编排。一次对话负责提出目标,Dynamic Workflows 负责生成任务图,子 agent 承担并行实验,回测结果决定下一轮分支,最后把验证过的编排逻辑固化为可复用程序。对开发者而言,这类机制比单纯延长上下文更实用,因为它把长任务拆成了可观察、可恢复、可重试的执行单元。
量化案例中的收益和风险结论属于 Qwen 官方演示,不能直接替代真实交易系统中的数据质量检查、成本模型和风险控制。可复用的技术部分是任务分解、并行实验和结果驱动的流程调整。
芯片设计:代码、仿真与物理实现形成闭环
芯片设计案例展示了另一种反馈形式。目标是一个 GCD / RSA 密码硬件加速器,验证环境使用 cocotb,仿真、综合和物理设计工具链包含 Iverilog、Yosys 和 OpenROAD。模型需要保持 4、6、8 和 16 位配置的 bit-exact 正确性,同时降低综合后的门数量。
一次连续运行中,模型完成约 500 个 turns,在 13 个关键里程碑上执行 71 次评估。第一个功能可用设计为 8298 个 gates,最终降至 678 个 gates。优化过程包括:
- 用迭代移位减法结构替代 16 位硬件取模除法器,门数量由 8298 降至 2010。
- 删除冗余 reduction 阶段,合并共享模块并缩窄内部寄存器位宽,门数量降至 1304。
- 清理寄存器和控制状态机,门数量降至 907。
- 融合模块、共享减法器并继续做门级优化,最终得到 678 个 gates。
物理实现结果也被纳入评估。初始布局的 die 为 106×106 µm²,wirelength 为 33369 µm,timing slack 为 -4.46 ns。最终布局为 46×46 µm²,wirelength 降至 4187 µm,在 500 MHz 下达到 +0.66 ns slack,物理 die 面积减少 81%。
这个案例把模型的工作范围推进到代码之外:它要读取仿真失败信息,定位逻辑冗余,修改 RTL,重新综合,再用布局和时序结果决定下一步。每一次修改都必须经过自动化验证,反馈来自真实工具链的执行结果。
多模态智能体的反馈位置
Qwen 官方还把视觉能力放在任务执行过程内部。对于超过 200 页的财务报告,模型可以处理文字、图表和文档布局;对于超过 100 小时的视频,模型可以组织人物、事件、时间戳和场景,形成视频记忆图。Qwen-MM-Plugins 则提供图像和视频处理、多模态记忆、动态分辨率、视觉工具使用,以及视频编辑、Blender 和 CAD 等扩展能力。
在界面重建任务中,模型会观察页面布局、物体方向、空间关系、动画质量和交互结果。发现电视朝向错误、界面对齐异常或视觉结果偏离目标后,系统重新规划并修正产物。视觉输入由此参与计划、执行、检查和迭代,形成跨阶段的反馈回路。
API 调用方式
Qwen3.8-Max 通过 QwenCloud 提供兼容 OpenAI Chat Completions、Responses 和 Anthropic API 的接口。官方示例支持 reasoning_effort,可用 xhigh、medium 和 low 调整推理深度与成本:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url=os.environ.get(
"DASHSCOPE_BASE_URL",
"https://dashscope.aliyuncs.com/compatible-mode/v1",
),
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "user", "content": "检查这个 Go 服务的故障恢复路径。"}
],
extra_body={"enable_thinking": True},
reasoning_effort="xhigh",
)
print(response.choices[0].message.content)参数选择可以按任务类型处理:复杂代码修改、科研复现和多步骤分析使用 xhigh,交互式开发使用 medium,对延迟和成本敏感的简单任务使用 low。长程任务仍需要外部 harness 维护状态、工具权限、测试和恢复逻辑,模型参数本身不会替代这些工程组件。
结语
Qwen3.8-Max 的发布材料提供了一套完整的长程智能体设计样本:模型负责规划与生成,harness 负责状态和工具,执行环境负责提供真实反馈,统一奖励系统负责把不同结果纳入训练,Dynamic Workflows 负责把复杂计划拆成可运行的任务图。
当任务包含代码、数据、界面或硬件工具链时,交付质量取决于反馈回到模型的速度、准确度和可执行性。Qwen3.8-Max 的案例把这条链路展示在自动编程、论文复现、量化研究、芯片设计和多模态应用中,也给使用 Claude Code、Codex、Qwen Code、OpenClaw 或 Hermes 的开发者提供了明确的集成方向。
来源:
- Qwen3.8-Max:编程与办公,全面跃升
- Unified Data Selection for LLM Reasoning,DOI: 10.48550/arXiv.2605.22389
- oh-my-cli