今天,我们正式发布 Qwen 3.8-Max,这是 Qwen 家族迄今能力最强的模型。这也标志着我们将首次开源 Qwen-Max 级别模型的权重——开放权重将于下周发布。基于 Qwen 3.5 的架构基础,Qwen 3.8-Max 扩展至 2.4 万亿参数,在编程、工作、研究和长周期任务方面实现了全面改进。它不仅能回答更具挑战性的问题,还能以更高的可靠性端到端完成复杂任务,产出可信赖的成果。
- Qwen3.8-Max——现可通过 QwenCloud 使用:
- 2.4T 参数(95B 激活参数),开放权重将于下周发布
- 在编程、工作、研究和长周期任务方面实现全面改进
- 端到端、可靠地交付复杂任务
- 通过 QwenCloud 上的 API 调用。
编程#
对于顶级模型而言,如今的编程远不止按需编写一个函数——它意味着独立将一个真实的、为期数天的项目从空文件夹一路推进到最终成品。我们在三项此类挑战中测试了 Qwen3.8-Max,每一项结果都必须通过实际编写和运行代码来获得,全程没有任何人工帮助。贯穿这三项挑战的一条主线是:Qwen3.8-Max 不只是遵循固定计划——它通过反馈循环实现自我进化,无论是构建一个能自我升级的测试框架、在一次次实验中打磨研究方法,还是通过一次次提交在竞赛排行榜上攀升。
10 天以上自主编程:构建自我进化的测试框架#
在此案例中,Qwen3.8-Max 被要求从零开始创建 oh-my-cli 项目,并在 10 天以上的长周期自主编程运行中,构建一个自我进化的测试框架。它将用户反馈、先进社区实践以及模型自身的自测结果整合到一个工程循环中:需求被规范化为 issue,由智能体自动认领并执行,并通过代码、测试、预览和日志持续迭代。完整项目轨迹已在 GitHub 仓库 qwen-code-dev-bot/oh-my-cli 中公开。
自主编程测试框架的关键实现细节:
- 循环工程设置:任务状态、调度与恢复。Qwen3.8-Max 将问题状态机、调度器、监控器和看门狗整合到一个执行循环中:当新需求进入 GitHub Issues 后,智能体通过状态机认领该任务,并依次经历 ready → leased → active 状态;实现完成后,触发 E2E 测试和 CI 检查,通过后 PR 被合并。
- 自测:产品自测与维护。每次更新后,模型触发 Build、Unit Test、E2E 和 Desktop Lifecycle 验证;异常状态会被路由回相关 issue / PR 进行修复和重新验证。
- 多源演进:来自多种需求信号的产品升级。通过将社区经验和用户 / 开发者反馈转化为可执行任务,该 harness 持续演进 /goal、/resume、Dynamic Workflow、Session Replay、Desktop 等功能。
截至 2026 年 7 月 30 日,经过约 16 天的全自主 AI 运行,该仓库累计产生了 265 个提交、127 个 PR 和 151 个 issue,展现了持续演进的自主编码能力。
视频 1。在一次 10 天以上的长周期自主编码运行中,Qwen3.8-Max 自主构建了一个自我演进的 harness,持续完成社区需求收集、问题调度、代码生成、验证和自我修复。
复现一篇研究论文——然后加以改进#
我们将一篇近期研究论文——“Unified Data Selection for LLM Reasoning”——交给 Qwen3.8-Max,并要求它:先用代码复现论文中的实验,然后尝试做得更好。该论文探讨了 AI 训练中一个非常实际的问题:当你的数据量远超训练所能承受的范围时,哪些样本真正值得保留?论文给出的答案是优先保留充满“艰难决策点”的样本——即在解题过程中模型真正不确定下一步该往哪走的时刻。
关键在于:Qwen3.8-Max 的起点只有论文和一批 GPU——没有起始代码,没有现成流程。数据处理脚本、训练代码、评估设置——它必须从零开始设计和编写全部内容,而这正是熟练工程师需要数天才能完成的工作。
它完全自主地工作了大约五天(约 125 小时的持续努力),Qwen3.8-Max 编写了约 7,600 行代码,执行了 1,100 多次操作,并运行了 33 轮 GPU 训练。它首先花了约 37 小时从零重建论文的完整流程,并复现了论文的六项主要发现——反复在其筛选的数据上微调 Qwen3-8B 模型,并确认了在困难数学基准上的提升(例如,论文的筛选方法在 AIME24 上比随机挑选数据高出 +7.7%)。
然后它更进一步,将复现转化为自我进化。在接下来的约 88 小时里,它运行了一个自我改进的研究循环——形成假设 → 编写代码 → 在 GPU 上运行 → 分析 → 再试一次——在四轮中自主提出并测试了 18 个改进想法。每一轮的结果都输入到下一轮的假设中,通过诊断每次尝试的问题所在,它最终演化出一种新方法,超越了论文自身的方法,在竞赛级数学基准 AIME24 上取得了 +2.7 个百分点的提升。
展开
改进搜索如何展开——4 轮,18 个想法
| 轮次 | 该轮最佳想法 | 得分(AIME24) | 相对基线的提升 |
|---|---|---|---|
| — | 论文方法(已复现,基线) | 49.58% | — |
| 1 | 筛选前先按难度拆分数据 | 50.42% | +0.84 |
| 2 | 按熵–得分差距对样本加权 | 51.67% | +2.09 |
| 3 | 调整筛选宽度 | 51.25% | +1.67 |
| 4 | 统计困难决策点(“nhighgate”)★ | 52.29% | +2.71 |
24 小时内击败数百支人类团队#
接下来,我们将 Qwen3.8-Max 提交到一个真实的在线竞赛——WWW2025 多模态对话意图识别挑战赛,该赛事在阿里云天池平台上举办,共有 526 支人类团队参赛。任务:阅读客服对话——包括文本和截图——并正确判断客户的需求。
在完全自主运行且严格限时 24 小时的条件下,Qwen3.8-Max 阅读了比赛规则,并用代码构建了完整的解决方案。在文本方面,它微调并集成了多个中文语言模型——BERT、MacBERT 和 RoBERTa;在产品截图方面,它微调了一个视觉语言模型 Qwen2.5-VL-7B,并辅以 Chinese-CLIP 模型来处理其主模型不确定的图像。随后,它将所有这些融合到一个单一的加权投票系统中,通过交叉验证来校准每个模型投票的权重,并添加额外的图像投票者来打破平局。在 45 次提交中——每一轮的反馈都指导着下一轮的微调和权重重新分配——它的准确率从 0.60 稳步攀升至最终的 0.853,击败了 526 支人类队伍中的 458 支(占参赛队伍的 87%)。
展开
这三个案例共同展示了 Qwen3.8-Max 的突出之处:它能够连续数天专注于一个困难、开放式的目标,提出自己的想法,并将其转化为可用的成果——全程无需人工介入。
工作#
除了编程之外,真实工作——那些杂乱、多步骤、重度依赖工具的任务,几乎填满了每个职业的日常工作——是前沿模型创造巨大经济价值的另一条主要赛道。因此,让 Qwen3.8-Max 在这些工作流程中具备广泛的能力和可靠的稳健性,是我们使命的核心。
扩展真实世界强化学习系统。通过联合扩展强化学习环境和计算资源,我们在多个流行的测试框架(QwenWork / Claude Code / Codex / OpenClaw / Hermes)上统一提升了通用工作能力。实现这一目标需要解决三个相互关联的挑战:
- 沿着独立维度持续扩展解耦的真实环境——任务(单任务 → 多任务 → 多日)、工作空间(多文件 → 分层文件夹 → 复杂异构文件夹)和框架(类别、版本、技能)——从而使环境增长以组合方式复合增长,而非需要定制化集成。
- 一种通用奖励系统,将异构验证方式内化——涵盖基于执行的检查、针对文本与渲染视觉输出的规则条件判定,以及智能体式审查——并置于可自动扩展的规则体系之下。通过将多种验证模态统一于单一奖励系统,它在所有环境中提供了一致且可靠的奖励来源,消除了维护任务专属验证器所固有的不一致性。
- 一种在线数据均衡器,对每个批次进行塑形,使其在任务、难度、工作空间和测试框架上的分布保持高度均衡,从而抑制批次间的梯度方差,进而维持强化学习算力的稳定、持续扩展。
二者共同提供了广度、可靠奖励与稳定性——将环境与算力的联合扩展转化为实际工作能力可衡量的横向提升。
图 1:随着强化学习训练的持续扩展,Qwen3.8-Max 在数十个内部及公开工作基准上展现出稳定、一致的提升。
图 2:Qwen3.8-Max 在多个测试框架上取得了相当的性能表现,包括 QwenWork、Claude Code、Codex、OpenClaw 和 Hermes。
在数百个高价值职业中测试工作能力的广度#
随着前沿模型在经济价值日益重要的工作中扮演越来越广泛的角色,我们对 Qwen3.8-Max 在真实工作流程中交付生产级结果的能力广度进行了压力测试——覆盖数百个高经济价值职业中的高频任务。以下为几个代表性展示:
- 企业合规顾问——Qwen3.8-Max 在单次处理中从数百份文档的语料库中找出了 1,284 条相关条款,并在不到一小时内完成了全部审查。此类审查通常需要一支律师助理团队协作约一周时间才能完成。
- UI/UX 设计师——Qwen3.8-Max 为数字银行应用 NOVA 生成了一个高保真、可交互的原型——8 个屏幕,具备一致的设计系统,一次性交付,零轮人工修改,而传统工作流程通常需要 3–5 轮修改。
- 餐饮品牌创始人——Qwen3.8-Max 通读了上百份食材供应简报,一次性产出了一份包含 26 道菜的完整菜单。每道菜都标注了平均卡路里值和食材来源,食材成本率控制在 33.8%。这样的菜单开发,通常需要主厨和运营团队花费数周时间进行反复的配方测试、成本核算和打磨。
- 结构工程师——仅凭一套图纸,Qwen3.8-Max 就在浏览器中重建了一栋 30 层办公塔楼的抗震结构模型,自振周期、基底剪力和层间位移角均可悬停实时查看。在传统工作流程中,工程师需要借助专业建模软件手动搭建模型,通常耗时一周以上。
- 康复治疗师——Qwen3.8-Max 将一张 2D 纸质评估表转化为 3D 交互演示,支持自由旋转视角和逐层解剖叠加显示,让患者能直观看到损伤的具体位置以及康复进展——这项工作以往外包给医学动画工作室,交付周期为 2 至 4 周,成本高达数千美元。
- 体育数据分析师——Qwen3.8-Max 在几十分钟内将每名球员约 8,400 次攻防回合解析为可直接使用的球员战术档案和教练报告。传统分析团队需要手动完成战术切分、因果归因和报告撰写——这一流程通常要耗费数个工作日。
视频 1. 在数百个高价值职业中,Qwen3.8-Max 在真实工作流程中显著提升了人类生产力——展现了其工作能力的广度。
在单次会话中构建一套可盈利的端到端量化策略#
凭借其动态工作流构建能力,Qwen3.8-Max 以编程方式驱动任务规划,并精准编排大规模子智能体系统——将单次对话转化为一个端到端、自动化的量化研究闭环。
深度——端到端的ETF轮动策略研发。仅凭一行任务描述,Qwen3.8-Max自主规划了一个复杂的动态工作流,并持续工作数小时,交付了一套完整的ETF轮动策略——构建数据系统、搭建基础因子、编排多轮贪心迭代,全程动态分析回测结果并修正方向。在整个过程中,它依据证据行事,而非遵循固定脚本:
- 当它观察到设计期指标与验证期指标之间出现偏差——这是典型的过拟合信号——便自动触发剪枝,逐轮剔除冗余因子。
- 当它发现多条路径收敛到同一组核心信号时,便加入多随机种子联合验证,以消除路径依赖。
- 当它判断在小截面数据上三模型集成不如固定方向合成稳健时,便自主切换到了更合适的策略框架。
广度——大规模并行因子挖掘。因子研究涉及巨大的搜索空间,而传统工作流仍是串行的。Qwen3.8-Max将这一过程并行化:仅凭涵盖动量、价值、质量、投资、低风险、情绪这六大经典因子族系的六段简短描述,它将每个因子族分解为50个研究方向,派出约330个子智能体,完成约6,000次回测,并在运行过程中持续调整工作流。最终入选因子的超额夏普比率达到0.64–1.48,IC值全部为正,区间为0.010至0.014。
从连贯的单线研发到对庞大假设空间的并行探索,Qwen3.8-Max借助动态工作流将编排逻辑固化为可复现的程序——把原本需要研究员数周至数月串行完成的量化研究,压缩为单次对话内即可交付的可扩展自动化闭环,展现了该模型在长周期自主任务上的广阔潜力。
视频2。Qwen3.8-Max有望让量化研究员级的专业能力触手可及——展示了其工作能力的深度。
长周期任务#
在应对高度复杂、长周期且多约束的任务时,Qwen3.8-Max 展现出了卓越的系统级自主规划与端到端闭环自适应学习能力。无论是在数字芯片设计中应对严苛的物理约束,还是在竞争激烈、讲究策略的商业模拟中,该模型都能通过“行动—反馈—迭代”的循环,在数千轮交互中实现深度的算法与策略重构。
自主芯片设计与闭环反馈驱动的优化#
Qwen3.8-Max 已自主完成整个硅片设计流程,涵盖逻辑重构、多约束优化以及物理版图生成。目标设计是一款集成模幂运算与模乘运算的 GCD / RSA 密码硬件加速器。该模块基于 GCD 数据通路与控制通路构建,是典型的结构紧凑但逻辑密集的数字电路。在随机化的 cocotb 验证框架下,模型需在 4 位、6 位、8 位及 16 位配置下保持逐位精确的功能正确性,同时最小化综合后的门数(Yosys 单元数)——这直接回应了前端硬件设计中面积与正确性之间的经典权衡。面积性能基于 16 位(WIDTH = 16)配置进行评估。
Qwen3.8-Max 在集成了仿真(Iverilog)、综合(Yosys)和物理设计(OpenROAD)工具链的沙盒环境中优化了该设计。从最简输入出发——包括基础任务描述、包含空模块模板的 RTL 工作区骨架,以及用于验证和综合的评估脚本——Qwen3.8-Max 完全自主运行。在没有任何黄金参考设计或人工干预的情况下,该模型独立完成了从高层算法架构设计到 RTL 代码生成,再到多轮迭代优化的全过程。
在单次连续自主运行中,Qwen3.8-Max 完成了约 500 轮交互和 71 次评估,跨越 13 个关键里程碑,对设计进行了端到端的重构。该模型自主完成了 RTL 编辑、仿真调试、综合分析与冗余定位,并迭代式地重新设计了数据通路架构——从最初的缺陷修复逐步推进到深层的算法级重写。虽然其首个功能可用的设计方案包含 8,298 个门,但 Qwen3.8-Max 将其缩减至 678 个门,在所有受评估模型中表现最佳。这一演进轨迹表明,Qwen3.8-Max 即使在运行数百轮之后仍能实现重大的结构性突破,而非在早期轻松取得收益后便陷入平台期。
演进过程中的关键设计里程碑:(演进记录完整保留了每个阶段的电路拓扑结构及对应的代码差异详情)
- 算法级重写:模数除法器改为迭代移位-减法(8,298 → 2,010 个门,第 22 轮)这是最大的一次优化步骤。Qwen3.8-Max 将 modular_multiplier 中昂贵的 16 位硬件模数除法器替换为迭代移位-减法架构,一步便削减了 6,288 个门——占整体面积缩减的 80% 以上。
- 冗余消除与位宽裁剪(2,010 → 1,304 个门,第 35–48 轮)模型识别到调用方的前置条件后,安全地绕过了整个 REDUCE 阶段,将两个独立的归约模块合并为一个共享模块,将输出路径优化为组合逻辑,并收窄了内部寄存器 k_ff 的位宽。
- 寄存器与控制状态机精简(1,304 → 907 个门,第 60–113 轮)模型移除了冗余的 base 和 mod 寄存器以及 k_nz 触发器,引入了偶数提前退出机制,利用减法器的最高有效位(MSB)作为比较器,并将 GCD 模块中独立的“先比较再减法”逻辑合并为单一的可复用减法器。
- 模块融合与逻辑共享(907 → 765 个门,第 170–252 轮)通过消解模块边界,模型将乘法器直接内联到模幂运算有限状态机(FSM)中,合并了三个子模块,并在全局范围内共享了一个减法器,从而消除了跨模块的冗余接口和重复逻辑。
- 门级优化(765 → 678 个门,第 443–500 轮)利用共享 NOR 门树、绝对差减法拆分(abs-sub splitting)以及字节到比特的选择逻辑等局部优化手段,模型进一步压缩了最终的门级冗余。
为验证前端优化能否转化为物理实现,Qwen3.8-Max 使用 OpenROAD(Nangate45 PDK)将 RTL 设计跑通了标准的布局布线(PR)流程,生成了物理硅片版图。在物理版图表示中,每颗芯片都展示了实际的布线结果:标准单元铺设在裸片的物理平面上,金属布线层堆叠于其上(每一层以不同颜色标示,并通过垂直通孔相连)。初始设计占用 106×106 µm² 的裸片面积,总线长为 33,369 µm,并存在严重的时序违例(负松弛为 -4.46 ns)。最终版图缩小至 46×46 µm² 的裸片面积,线长降至 4,187 µm,并在 500 MHz 频率下成功达成时序收敛(松弛为 +0.66 ns)。这意味着物理裸片面积缩减了 81%,证明高层级的前端架构优化能够直接转化为高度紧凑、可布线性良好且性能优异的硅片实现。
展开
该案例凸显了 Qwen3.8-Max 作为自主、长周期硬件智能体基础模型的两项关键能力:
- 长周期持续优化:模型能够在数百轮复杂交互中保持高度连贯、系统化的策略,深入驱动算法级数据通路重写,而非停留在浅层的语法调整上。
- 反馈驱动的闭环优化:在没有先验参考设计的情况下,模型完全依赖“编辑—仿真—综合—布局”的反馈循环来驱动优化。每一轮设计迭代都通过自动化 cocotb 功能测试严格验证,物理可行性则完全由 OpenROAD 后端验证来保障。
长期运营中的持续学习#
E-Commerce Bench 是一个为期 365 天的长周期电商运营仿真基准,旨在评估大语言模型在持续运营场景中的商业决策能力。该基准基于淘宝和天猫的真实脱敏交易数据构建,深度复现了一个包含 12 种店铺类型、60 个商品类目、近 600 家供应商和 7,000 种商品的复杂生态系统。模型获得 10 万元人民币的启动资金,需同时运营多家线上店铺。在整整一年中,它必须应对季节性需求波动、突发环境事件,以及高度拟真的电商结算体系带来的现金流压力。模型必须自主做出全链路决策,包括选品、供应链谈判、库存管理、动态定价和退货处理,最终目标是在年底实现总余额最大化。这也考验了模型全年的资金配置策略——它需要知道何时应主动投资以谋求增长;同样重要的是,它必须在周期结束前将库存和经营收益转化为现金,否则账面上未变现的资产会拖累最终成绩。
在价格谈判中,该基准引入了一个基于博弈论原理的供应商矩阵,其中每个供应商都拥有独特的个性特征和让步策略。这要求模型通过多轮自然语言交互进行谈判。Qwen3.8-Max 在谈判中展现了持续学习能力。它对同一供应商的同一产品进行了深入试探,实现了采购价格的逐步降低和利润的逐轮稳步增长。这使得谈判效率(以雷达图面积表示)随时间持续扩大。此外,它还将这种谈判经验有效泛化到了类似产品上,而其他模型的谈判效率通常在中途就陷入停滞。
此外,模型还需应对表面之下的隐藏风险和复杂的市场节奏。在近 600 家供应商的矩阵中,该基准秘密嵌入了 152 家欺诈商户,涵盖了诸如“会员费陷阱”、“低价诱饵”和“货不对板”等经典诈骗模式。这全面考验了模型的风险控制能力。同时,年度大促期间订单激增的压力与随机发生的供应链危机(如台风、物料短缺)相互交织,将模型的备货节奏和危机管理能力推向了极限。在此背景下,Qwen3.8-Max 展现出了卓越的前瞻性规划能力。它在运营的最早阶段投入了最多的资金以确立自身地位,这加速了其后续的资产增长曲线。它还在年末大促期间实现了超过 10 万元人民币的净利润——几乎是第二名 GLM 5.2 的 2.4 倍。
Qwen3.8-Max 最终以 ¥416,252 的总余额(4.16 倍回报)位居第一,比第二名的 GLM 5.2 高出 38%。这也比其上一代旗舰模型 Qwen3.7-Max 提升了 152%。这些结果表明,Qwen3.8-Max 在长周期连贯决策方面具有优势。此外,它还能从交易反馈中自适应学习,在超过 2,000 轮交互中持续迭代进化,而不是僵化地固守早期学到的策略。
多模态智能体#
从所见即所行,Qwen3.8-Max 不仅能理解图像、文档和视频,它还提供了贯穿整个任务生命周期的视觉智能。
在处理财务报告和超过 200 页的复杂 PDF 时,Qwen3.8-Max 能够跨页面理解文本、图表和文档版式,从海量信息中提取关键洞察,并将其转化为结构化报告或可直接上线的 Web 体验。在处理超过 100 小时的视频时,它不仅能定位特定时刻并回答细节问题,还能将人物、事件、时间戳和场景组织成视频记忆图谱,在长时间跨度内持续建立关联,以还原事件脉络、人物关系和关键时刻。
无论输入是数百页的文档、一整部电视剧,还是 100 小时的直播,原本难以消化的信息都可以被转化为可搜索、可追溯、可交互的知识结构。
除了理解能力,Qwen3.8-Max 还能执行真实的视觉生产任务。它可以将个人素材剪辑成 vlog,把一个提问变成沉浸式教育动画,从一张界面截图重建完整的前端项目,将户型图转化为基于 Blender 的 3D 室内效果图,并能根据自然语言需求开发交互式游戏和应用。
更重要的是,视觉能力并不局限于输入阶段。在执行过程中,Qwen3.8-Max 会持续观察并评估自身的中间结果。它可以检查页面布局、物体朝向、空间关系、动画质量和交互结果。当它发现问题时——比如电视朝向错误、界面错位,或视觉结果与预期设计不符——它能够识别偏差、修订计划,并自主修正输出。
这意味着视觉不再仅仅是智能体用来理解输入的另一种模态。它成为贯穿规划、执行、验证和迭代的原生反馈闭环。模型边生成边观察,边行动边审视,反复检查结果、发现问题并改进工作。这种视觉反馈闭环让智能体不再只是完成任务,而是把任务做好。
Qwen3.8-Max 正在帮助多模态智能体从理解世界,进化为通过视觉在世界中持续行动和创造。
在数字世界中,独立完成一项复杂任务往往需要同时具备两种能力:编写代码来实现底层逻辑,以及手动操作界面来驱动任务并观察结果。这种混合智能体能力——编码与 GUI 操作的结合——让两条通道互为补充:编码高效且大规模地完成繁重工作,而 GUI 操作则能触达人类所能看到和交互的一切,同样重要的是,它能把真实系统中的实际运行情况反馈回来——将上述视觉反馈闭环从检查自身输出,扩展到对照真实运行中的应用程序进行验证。
为了衡量这一点,我们推出了 RecreationBench,这是一个覆盖五个平台——桌面端(Ubuntu、macOS、Windows)、移动端(Android)和网页端——的长周期应用复刻基准。模型只能将真实运行中的应用视为黑盒来观察——没有源代码,无法访问互联网——纯粹通过交互和反馈来理解它,然后从零开始重建整个应用。在此任务上,Qwen3.8-Max 已经展现出前沿级的混合智能体能力,通过反复的迭代编码和交互反馈循环,逐步逼近原始应用。
为了让这些能力更容易集成到现有的智能体系统中,我们还推出了 Qwen-MM-Plugins。这是一个面向多模态智能体的工具扩展库,为智能体框架提供图像和视频处理、多模态记忆、动态分辨率支持、视觉工具调用,以及针对视频编辑、Blender 和 CAD 等任务的专门能力。借助 Qwen-MM-Plugins,任何现有的智能体框架都可以扩展为更天然的多模态原生系统。
用户反馈#
对 Qwen3.8-Max 最诚实的评价来自那些真正将其投入实际工作的人。顶级智能体平台、领先的开源算法团队、法律、金融和制造业的专业公司、初创小团队、独立开发者以及学术研究人员——他们都持续将最复杂、最关键任务和最长周期的任务交给它。
企业用它来搭建大规模智能体系统。知识工作者把他们的图片、文稿和视频交给它,就能得到全部处理。开发者直接把最繁重的工程任务交给它。研究团队用它端到端地跑通文献、数据和仿真的完整循环。一个模型,在如此多样的工作中被如此频繁地使用,以至于变得不可或缺。结论是一致的:Qwen3.8-Max 能够驱动长周期、自主的任务链,并一次性产出可交付的结果。
完整基准测试表#
| Opus4.8 | Fable5 | GPT5.6 Sol (max) | Qwen3.7-Max | Qwen3.8-Max | |
|---|---|---|---|---|---|
| 编码智能体 | |||||
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 74.5 | 86.6 |
| SWE-bench Pro | 69.2 | 80.0 | 64.6 | 60.6 | 67.7 |
| DeepSWE 1.1 | 59.0 | 70.0 | 73.0 | 21.6 | 56.6 |
| NL2Repo-Bench | 69.4 | — | — | 47.2 | 55.9 |
| FrontierSWE | 70.0 | 88.8 | — | 40.7 | 73.5 |
| MLS-Bench-Lite | 42.8 | 49.9 | 46.2 | 31.7 | 41.0 |
| PaperBench | 80.3 | 88.8 | 90.5 | 64.8 | 93.0 |
| AndroidBench | 69.8 | 84.5 | 74.0 | 56.5 | 70.2 |
| QwenSWEBench | 84.0 | 86.3 | 73.5 | 63.4 | 80.7 |
| QwenQoderBench | 62.7 | 63.1 | 53.8 | 36.8 | 58.4 |
| QwenReactBench | 1694 | 1770 | 1564 | 1538 | 1724 |
| QwenSVGBench | 1648 | 1690 | 1758 | 1499 | 1713 |
| 通用智能体 | |||||
| CoWorkBench | 72.3 | 75.9 | 71.5 | 64.6 | 74.8 |
| WorkSpaceBench | 66.8 | 68.7 | 65.6 | 61.4 | 67.7 |
| JobBench | 48.4 | 57.4 | 45.4 | 31.3 | 53.4 |
| SkillsBench | 65.1 | 70.9 | 73.5 | 61.2 | 70.2 |
| Agents’ Last Exam(通过率 / 得分) | 27.0 / 45.1 | — / — | 30.6 / 53.6 | 11.8 / 31.1 | 27.0 / 52.4 |
| Automation-Bench(Pass@1) | 27.2 | 29.1 | 29.7 | 14.2 | 27.3 |
| Toolathlon Verified(Pass@1) | 76.2 | 77.9 | 74.9 | 49.7 | 72.5 |
| WideSearch | 72.9 | 81.2 | — | 75.2 | 81.9 |
| HLE(带工具) | 57.9 | 64.5 | 58.0 | 53.5 | 56.2 |
| 通用能力 | |||||
| GPQA Diamond | 92.0 | 92.6 | 94.1 | 92.4 | 92.6 |
| HLE | 45.7 | 53.3 | 47.2 | 41.4 | 43.6 |
| IFBench | 62.2 | 63.5 | 72.7 | 79.1 | 82.8 |
| $OneMillion-Bench(专家评分) | 41.8 | 55.9 | 53.8 | 44.4 | 52.5 |
| HealthBench | 52.4 | — | 55.3 | 54.5 | 60.2 |
| PLawBench | 69.6 | 70.2 | 72.3 | 58.9 | 73.2 |
| PRBench-Legal | 52.7 | 57.6 | 57.6 | 48.5 | 57.6 |
| PRBench-Finance | 51.9 | 55.8 | 55.5 | 46.8 | 58.3 |
| MRCR v2 256K(8 针检索) | 83.2 | — | 93.8 | 86.7 | 92.9 |
| LongBench v2 | 69.1 | — | 67.1 | 65.3 | 66.3 |
- Fable5 的结果可能涉及回退机制。
- Terminal Bench 2.1:使用 Claude Code 进行评估(avg@10),超时时间为 5 小时,max_tokens=131,072。对于所有其他模型,我们报告各测试框架中已发布的最佳得分:Claude Opus 4.8 和 Claude Fable 5 采用来自 Artificial Analysis 的 Terminus 2(https://artificialanalysis.ai/evaluations/terminalbench-v2-1);GPT-5.6 Sol 采用 Codex(https://openai.com/index/previewing-gpt-5-6-sol/)。
- SWE-bench Pro:使用 Claude Code 测试框架进行评估,temp=1.0,top_p=0.95,上下文窗口为 256K。已修正有问题的任务,并在优化后的基准上评估了所有基线。
- DeepSWE 1.1:使用 Claude Code 和 mini-SWE-agent 测试框架进行评估,temp=1.0,top_p=0.95,上下文窗口为 256K。我们报告两个框架中的最高得分;值得注意的是,Qwen3.8-Max 在 Claude Code 上表现最佳。
- NL2Repo-Bench:使用 Claude Code 测试框架进行评估。为防止奖励作弊,我们禁用了试图访问特定仓库的 Bash 命令,例如 pip download、pip install 和 git clone。
- FrontierSWE:使用 Claude Code 测试框架进行评估。所有其他可用的 MEAN@5 结果均取自截至 2026 年 8 月 3 日的官方 FrontierSWE 排行榜(https://www.frontierswe.com)。优势分数是使用官方评估脚本根据原始分数重新计算的。“–”表示截至该日期尚无官方 MEAN@5 结果。
- MLS-Bench-Lite:使用 Claude Code 进行评估,超时时间为 5 小时,max_tokens=131,072。所有其他模型分数均取自官方排行榜。
- PaperBench:在 Code-Dev 模式下的 BasicAgent 设置中进行评估,由 Claude Opus 4.6 评判,并对 3 次运行结果取平均值(每次运行最长 12 小时)。
- AndroidBench:在包含 95 个任务的公开子集上进行评估,报告 avg@3 分数。
- QwenSWEBench:用于评估模型软件工程能力的内部编码基准。使用 Claude Code 测试框架进行评估。报告 avg@3 分数,超时时间为 8 小时,max_tokens=32,768,temperature=1.0,上下文窗口为 256K token。
- QwenQoderBench:用于评估 Qoder 用户体验的内部编码基准。使用 Claude Code 测试框架进行评估。报告 avg@5 分数,超时时间为 6 小时,max_tokens=32,768,temperature=1.0,上下文窗口为 256K token。
- QwenReactBench:使用 Claude Code 作为测试框架的内部 React 项目构建基准,双语(英文/中文),涵盖 7 个类别;采用自动渲染 + 多模态评判;BT/Elo 评分。
- QwenSVGBench:内部 SVG 代码生成基准;双语(英文/中文),采用自动渲染 + 多模态评判;BT/Elo 评分。
- CoWorkBench:内部协同工作基准,用于评估涵盖计算机科学、金融、法律、医疗及其他生产力领域的长期任务。
- SkillsBench:在公开的 SkillsBench v1.1 基准上进行了评估,涵盖 87 个任务,报告每个任务三次运行的平均分数。Opus 4.8 和 Fable 5 在 Claude Code 上评估;GPT-5.6 Sol 在 Codex 上评估;Qwen 系列在 OpenCode 上评估。所有结果均来自我们自己的测试。
- Automation-Bench:在包含 600 个任务的公开子集上进行评估。
- WideSearch:外部模型使用 Claude Code 测试框架进行评估,我们自己的模型使用 Qwen-Agent 测试框架进行评估,报告四次运行的平均 item-F1 分数。
- $OneMillion-Bench:使用 gemini-3.1-pro-preview 进行评估。
- PLawBench:使用 gemini-3.1-pro-preview 进行评估。
- 空单元格(–):分数尚未公布或暂不适用。
| Opus4.8 | Fable5 | Gemini3.1-Pro | GPT5.6-Sol | Qwen3.7-Plus | Qwen3.8-Max | |
|---|---|---|---|---|---|---|
| 多模态推理 | ||||||
| MMMU-Pro | 75.6 | 81.2 | 80.5 | 83.0 | 79.0 | 82.3 |
| MathVision | 87.1 / 97.1 | 92.7 / 98.6 | 87.4 / 95.7 | 90.8 / 97.8 | 90.3 / — | 95.2 / 97.7 |
| BabyVision | 28.4 / 81.2 | 42.5 / 90.5 | 55.9 / 68.3 | 65.5 / 88.9 | 64.7 / 70.4 | 82.0 / 91.3 |
| HLE-VL(使用工具) | — | — | 43.9 | 51.2 | 25.6 | 52.2 |
| ZeroBench(Pass@5) | 17.0 / 34.0 | 20.0 / 46.0 | 17.0 / 23.0 | 22.0 / 35.0 | 19.0 / 19.0 | 24.0 / 49.0 |
| ZeroBench-Sub | 31.1 | 37.1 | 36.5 | 46.7 | 41.0 | 48.5 |
| LogicVista | 76.7 | 85.7 | 82.6 | 89.7 | 84.3 | 91.9 |
| HiPhO | 69.3 | 78.6 | 85.4 | 86.8 | 84.1 | 90.0 |
| PhyX | 54.2 | 71.7 | 79.4 | 79.1 | 80.0 | 83.5 |
| SLAKE | 75.9 | 86.6 | 82.9 | 85.1 | 83.2 | 90.8 |
| MedXpertQA-MM | 71.7 | 80.0 | 80.7 | 81.5 | 71.0 | 80.4 |
| PMC-VQA | 59.2 | 63.2 | 62.5 | 62.3 | 63.4 | 66.2 |
| 视觉智能体与编程 | ||||||
| OSWorld-Verified | 83.4 | 85.0 | 76.2 | 83.2 | 73.3 | 86.1 |
| OSWorld 2.0 | 20.6 / 54.8 | — / 66.1 | 7.8 / 30.6 | — / 62.6 | 2.8 / 21.5 | 19.4 / 46.7 |
| ScreenSpot Pro | 82.3 | 87.3 | 68.1 | 81.3 | 79.0 | 84.5 |
| WebArena-Verified | 67.9 | 71.3 | 64.3 | 69.7 | 55.3 | 66.8 |
| AndroidWorld | 75.0 | 88.8 | 70.7 | 77.6 | 81.0 | 85.3 |
| MobileWorld | 67.5 | 85.5 | 58.1 | 76.9 | 51.2 | 77.8 |
| ClawEval-MM | 73.3 / 73.8 | 81.2 / 77.5 | 50.5 / 55.2 | 81.2 / 78.9 | 57.4 / 60.1 | 77.2 / 74.8 |
| Vision2Web | 62.4 | 70.5 | — | 62.1 | 42.1 | 69.0 |
| QwenBlenderBench | 62.4 | 69.5 | 23.0 | 68.6 | 41.5 | 69.9 |
| 参数化 CAD 基准 | 85.1 | 87.5 | 73.5 | 86.2 | 73.8 | 91.5 |
| RecreationBench | 48.0 | 56.1 | 16.2 | 47.6 | 30.2 | 51.7 |
| PresentBench | 80.9 | 79.8 | 55.4 | 82.9 | 65.7 | 79.6 |
| 文档与办公智能 | ||||||
| CharXiv(RQ) | 78.5 / 89.9 | 87.9 / 93.5 | 84.4 / 89.9 | 85.1 / 89.1 | 85.8 / 85.9 | 88.4 / 93.5 |
| OmniDocBench 1.5 | 86.5 | 89.5 | 90.0 | 86.7 | 91.4 | 92.1 |
| OCR-Bench-V2(英/中) | 53.9 / 55.3 | 65.3 / 58.1 | 64.6 / 58.2 | 69.0 / 57.3 | 70.7 / 67.1 | 74.2 / 68.3 |
| CC-OCR-Bench-V2 | 60.3 | 72.4 | 68.9 | 68.0 | 72.7 | 79.6 |
| MTVQA-Test | 48.1 | 41.6 | 54.3 | 52.7 | 51.2 | 56.6 |
| MADQA | 86.8 | 86.0 | 81.1 | 87.8 | 87.1 | 91.8 |
| QwenVisualOffice | 34.5 | 32.4 | 39.6 | 29.5 | 32.4 | 44.6 |
| 真实世界与空间理解 | ||||||
| RealWorldQA | 76.6 | 85.9 | 83.5 | 83.7 | 86.9 | 88.0 |
| ERQA | 57.2 | 70.0 | 68.0 | 70.0 | 69.8 | 77.8 |
| LingoQA | 73.8 | 77.4 | 66.8 | 72.6 | 83.4 | 84.8 |
| SURDS | 62.2 | 79.4 | 64.0 | 63.0 | 77.2 | 77.8 |
| 视觉感知与定位 | ||||||
| SimpleVQA | 67.3 | 73.4 | 73.1 | 66.6 | 70.3 | 75.0 |
| WorldVQA | 33.9 | 53.5 | 54.0 | 45.1 | 43.9 | 53.2 |
| MMStar | 76.7 | 80.5 | 84.0 | 82.5 | 83.2 | 85.9 |
| PerceptionBench | 47.2 | 57.2 | 56.2 | 59.7 | 51.1 | 63.5 |
| CountQA | 41.3 | 63.1 | 72.8 | 68.6 | 77.0 | 82.4 |
| RefAdv-S | 61.7 | 68.6 | 71.9 | 69.2 | 73.0 | 80.2 |
| Dense200 | 20.8 | 31.1 | 69.7 | 55.3 | 60.7 | 87.0 |
| COCO | 50.7 | 56.4 | 72.4 | 61.2 | 74.2 | 78.7 |
| VisFactor | 30.1 | 54.5 | 39.8 | 62.8 | 42.8 | 60.8 |
| VLMsAreBiased | 43.8 | 61.2 | 74.1 | 59.8 | 36.6 | 88.3 |
| 视频智能与智能体 | ||||||
| VideoMME(含字幕) | 85.4 | — | 86.7 | 89.5 | 88.0 | 90.4 |
| VideoMME v2(含字幕) | 49.0 | 52.2 | 66.9 | 71.1 | 59.7 | 68.3 |
| VideoMMMU | 75.3 | 81.2 | 85.3 | 85.0 | 85.4 | 88.7 |
| MMVU | 67.4 | 72.0 | 77.9 | 81.2 | 76.6 | 82.4 |
| MLVU(M-Avg) | 53.4 | — | 84.7 | 87.6 | 87.4 | 90.8 |
| TVBench | 61.5 | — | 73.0 | 83.2 | 78.2 | 81.9 |
| LVBench | 67.3 | — | 75.1 | 78.8 | 76.2 | 81.8 |
| LVBench(含记忆) | 84.3 | 90.1 | — | 84.2 | 74.5 | 85.6 |
| EgoLife(含记忆) | 78.3 | 82.3 | — | 70.8 | 68.8 | 80.3 |
| VideoDR(含搜索) | 65.6 | 77.1 | — | 71.3 | 41.0 | 73.2 |
- MathVision、BabyVision、CharXiv(RQ)和 ZeroBench:分数以“无置信区间 / 有置信区间”的形式报告。MathVision 和 CharXiv(RQ)中少量错误的地面真值标注已在人工核验后予以修正。
- MathVision:我们的模型使用固定提示词进行评估,例如“请逐步推理,并将最终答案放在 \boxed{} 中。”对于其他模型,我们报告在有无 \boxed{} 格式要求两种运行条件下取得的较高分数。
- MMMU-Pro:Gemini3.1-Pro 和 GPT5.6-Sol 的结果取自官方模型报告或系统卡。所有其他模型均为内部评估。
- ClawEval-MM:分数以“Pass@3 / 平均分”的形式报告。Pass@3 衡量在三次尝试中至少通过一次的百分比,平均分则是三次尝试的平均得分。
- Vision2Web:分数取前端、网页和网站三个类别的平均值,使用 Claude Code 运行框架,并以 gpt-5.4-2026-03-05 作为评判模型。
- HLE-VL(含工具):分数在启用工具的条件下评估,包括代码解释器(CI)和搜索。Gemini3.1-Pro 和 GPT5.6-Sol 启用工具版本的分数,是通过其官方原生工具调用 API 进行端到端测得的。
- OSWorld 2.0:分数以“二元 / 部分”的形式报告。二元分数是获得完整任务奖励的任务百分比,部分分数则汇总了所有任务中获得的局部奖励。
- ScreenSpot Pro:Opus4.8 和 Fable5 的分数取自官方系统卡。Fable5 的结果对应 Mythos 预览版的分数。所有其他模型均为内部评估。
- WebArena-Verified:分数使用 OSWorld 脚手架内的官方 WebArena 评分器进行报告。
- RecreationBench:一个内部的长时程应用复现基准,用于评估混合智能体在五个平台上的能力:Ubuntu、macOS、Windows、Android 和 Web。
- PerceptionBench:对比模型的分数取自该基准的官方发布报告,而我们的模型则是在内部进行评估。
- VideoMME(含字幕)和 VideoMME v2(含字幕):分数是在启用字幕的情况下评估的。
- QwenBlenderBench 和 QwenVisualOffice:两者均为内部基准。
- LVBench 和 EgoLife(含记忆):分数是使用基于 Qwen-MM-Plugins 构建的记忆系统进行评估的,该系统支持细粒度、长时程的视频记忆。
- VideoDR(含搜索):分数是在可访问搜索工具的情况下评估的。
- 空单元格(–):分数尚未公布或暂不适用。
使用 Qwen3.8 构建#
Qwen3.8-Max 现已通过 QwenCloud 提供。您可以将其与流行的智能体框架和编程助手集成。模型权重将于下周在 Hugging Face 和 ModelScope 上开源——敬请期待。
API 使用#
Qwen3.8-Max 官方支持 reasoning_effort 参数,可用于调整推理深度并控制成本:
- xhigh(默认):适用于需要深入分析的复杂任务
- medium:在准确性和速度之间取得平衡
- low:针对速度和成本进行优化的高效推理
此外,preserve_thinking 在所有工作负载下默认启用,以提供最佳的开箱即用体验。
QwenCloud#
QwenCloud 支持行业标准协议,包括兼容 OpenAI 规范的聊天补全和响应 API,以及兼容 Anthropic 的 API 接口。
"""
Environment variables:
DASHSCOPE_API_KEY: Your API Key from https://home.qwencloud.com/
DASHSCOPE_BASE_URL: (optional) Base URL for compatible-mode API.
- Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1
- Singapore: https://dashscope-intl.aliyuncs.com/compatible-mode/v1
- US (Virginia): https://dashscope-us.aliyuncs.com/compatible-mode/v1
"""from openai import OpenAIimport osapi_key = os.environ.get("DASHSCOPE_API_KEY")if not api_key: raise ValueError( "DASHSCOPE_API_KEY is required. " "Set it via: export DASHSCOPE_API_KEY='your-api-key'" )client = OpenAI( api_key=api_key, base_url=os.environ.get( "DASHSCOPE_BASE_URL", "https://dashscope-intl.aliyuncs.com/compatible-mode/v1", ),)messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]completion = client.chat.completions.create( model="qwen3.8-max", messages=messages, extra_body={ "enable_thinking": True, # "preserve_thinking": True, }, reasoning_effort="xhigh", # supported levels are xhigh, medium, and low stream=True,)reasoning_content = ""answer_content = ""is_answering = Falseprint("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")for chunk in completion: if not chunk.choices: print("\nUsage:") print(chunk.usage) continue delta = chunk.choices[0].delta if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None: if not is_answering: print(delta.reasoning_content, end="", flush=True) reasoning_content += delta.reasoning_content if hasattr(delta, "content") and delta.content: if not is_answering: print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n") is_answering = True print(delta.content, end="", flush=True) answer_content += delta.content
编程助手#
Qwen3.8-Max 可与流行的智能体框架和编程助手无缝集成:
Claude Code#
Qwen API 支持 Anthropic API 协议,可直接与 Claude Code 配合使用:
npm install -g @anthropic-ai/claude-code
export ANTHROPIC_MODEL="qwen3.8-max"export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max"export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<your_api_key>
claude
Codex#
Qwen API 支持 OpenAI Responses 协议,可与 Codex 配合使用:
在 ~/.codex/model-catalog.local.json 中
{ “models”: [ { “slug”: “qwen3.8-max”, “display_name”: “qwen3.8-max”, “description”: “Model Studio:Qwen3.8-Max”, “default_reasoning_level”: “xhigh”, “supported_reasoning_levels”: [ { “effort”: “low”, “description”: “快速响应,推理较轻” }, { “effort”: “medium”, “description”: “针对复杂问题提供更深入的推理” }, { “effort”: “xhigh”, “description”: “针对复杂问题提供超高深度推理” } ], “context_window”: 1000000, “effective_context_window_percent”: 95, “supports_parallel_tool_calls”: true, “supports_image_detail_original”: true, “input_modalities”: [“text”, “image”], “shell_type”: “default”, “visibility”: “list”, “supported_in_api”: true, “priority”: 1, “base_instructions”: “”, “support_verbosity”: false, “supports_reasoning_summaries”: false, “experimental_supported_tools”: [], “truncation_policy”: { “mode”: “bytes”, “limit”: 10000 } } ]}
在 ~/.codex/config.toml 中
toml
model_catalog_json = “~/.codex/model-catalog.local.json”model_provider = “ModelStudio”model = “qwen3.8-max”[model_providers.ModelStudio]name = “Model Studio”base_url = “https://dashscope-intl.aliyuncs.com/compatible-mode/v1″env_key = “OPENAI_API_KEY”wire_api = “responses”
npm install -g @openai/codex
export OPENAI_API_KEY=<your_api_key>
codex
Qoder CLI#
Qoder 与 Qwen 协同进化,赋能智能体编码:
curl -fsSL https://qoder.com/install | bash
qoder
Qwen Code#
Qwen Code 针对 Qwen 系列进行了深度优化:
npm install -g @qwen-code/qwen-code@latest
qwen
OpenClaw#
通过 QwenCloud 连接 OpenClaw:
curl -fsSL https://molt.bot/install.sh | bash
export DASHSCOPE_API_KEY=<your_api_key>
openclaw dashboard
配置 ~/.openclaw/openclaw.json:
{ “models”: { “mode”: “merge”, “providers”: { “modelstudio”: { “baseUrl”: “https://dashscope-intl.aliyuncs.com/compatible-mode/v1”, “apiKey”: “DASHSCOPE_API_KEY”, “api”: “openai-completions”, “models”: [ { “id”: “qwen3.8-max”, “name”: “qwen3.8-max”, “reasoning”: true, “input”: [“text”, “image”], “contextWindow”: 1000000, “maxTokens”: 65536 } ] } } }, “agents”: { “defaults”: { “model”: { “primary”: “modelstudio/qwen3.8-max” } } }}
摘要#
Qwen3.8-Max 是我们迄今为止能力最强的模型,也是首个 Max 规模的开放权重模型。其参数量扩展至 2.4 万亿,在编程、真实世界工作、长周期任务以及多模态智能体等方面实现了全面性能提升——能够以最少的人工介入,将复杂、开放式的目标从头到尾执行完毕,并产出可靠的交付成果。开放权重将于下周发布。我们欢迎社区反馈,并期待看到大家基于它构建的成果。




津公网安备12011002023007号