跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.08.04 · 12 min

Qwen3.8-Max 正式版:2.4 万亿参数开源,7 项基准超 GPT-5.6,但真正看点不在跑分

2026 年 8 月 3 日,阿里千问发布 Qwen3.8-Max 正式版——2.4 万亿参数 MoE,激活 950 亿,1M 上下文,原生多模态。7 项编程与 Agent 基准超越 GPT-5.6 Sol 和 Claude Fable 5,权重下周开源。同期 QwenWork 平台上线,16 天自主编程产出完整 Agent 框架。Preview 到正式版的两周,阿里补齐了开源生态的关键一环。

前沿动态

8 月 3 日上午,阿里千问正式发布 Qwen3.8-Max。2.4 万亿参数,激活 950 亿,1M 上下文,原生视觉理解,权重下周开源。

如果只看这几个数字,会觉得这只是 Qwen3.8-Max Preview(7 月 19 日静默上线)的正式版收尾。但真正值得看的,是这两周里阿里补上的另外几件事:7 项基准明确超越 GPT-5.6 Sol、QwenWork 工作平台上线、16 天无人干预自主编程的 demo、以及 Max 级模型首次开放权重。

Preview 验证了能力,正式版补齐了生态。

关键信息

维度
总参数 / 激活参数 2.4T / 95B
架构 MoE,基于 Qwen 3.5 架构扩展
上下文 1M tokens
多模态 原生视觉理解
开源 权重下周开放(Max 级首次)
同期发布 QwenWork AI 工作平台
定位 千问家族迄今规模最大、能力最强

对比 Qwen3.8-Max Preview 7 月 19 日的静默接入,正式版有三处关键升级:一是原生多模态能力补齐(Preview 是纯文本),二是基准成绩全面提升,三是开源承诺落地。在大语言模型赛道上,DeepSeek V4-Flash 正式版 也在同周开放公测。

7 项基准超 GPT-5.6:但要分项看

阿里在发布中明确列出 7 项编程和 Agent 评测超越了 GPT-5.6 Sol 和 Claude Fable 5。几个关键单项:

基准 Qwen3.8-Max 对比
PaperBench(论文理解与复现) 93.0 超越 GPT-5.6 Sol
Terminal-Bench 2.1 86.6 低于 GPT-5.6 Sol 的 88.8
编程/Agent 综合 7 项超越

这里要拆开看,不能笼统说"Qwen 超过 GPT-5.6"。

PaperBench 93 分是真正亮眼的成绩——这个基准测试的是模型读论文、理解方法、复现实验的能力,是科研型 AI 的核心指标。93 分意味着 Qwen3.8-Max 在科研复现任务上已经到了可用水平。

Terminal-Bench 86.6 vs Sol 的 88.8则是诚实的差距。Terminal-Bench 测的是终端环境下的多步任务执行,OpenAI 在这个方向上仍然领先。阿里没有回避这个差距,这是值得肯定的态度。

7 项超越 ≠ 全面超越。Qwen3.8-Max 的优势集中在编程、办公、长程 Agent,通用对话和极限推理仍有差距。

QwenWork:从模型到产品的关键一步

和 Qwen3.8-Max 同天上线的还有 QwenWork——基于该模型的 AI 工作平台。这标志着阿里从"发布模型"升级到"发布产品"。

QwenWork 的定位不是 ChatGPT 的翻版,而是面向工作场景的 Agent 平台。核心 demo 是:从空文件夹开始,Qwen3.8-Max 独立完成一个完整 Agent 框架的编写,16 天无人干预

这个 demo 的意义不在于"16 天"这个数字,而在于"无人干预"这四个字。过去 AI 编程的 demo 大多是"人写一段,AI 补一段",或者"AI 写完人 review 一遍"。16 天无人干预意味着模型能自己规划任务、自己调试、自己修复错误、自己推进项目——这是 Agent 能力的真正考验。

当然,demo 终归是 demo。真实工程场景下的复杂度、不确定性、需求变更,比"从空文件夹写一个 Agent 框架"要难得多。但这个 demo 至少证明了 Qwen3.8-Max 在长程任务上的上下文保持和自我纠错能力。

Max 级首次开源:阿里的生态赌注

Qwen3.8-Max 是千问家族首个计划开放权重的 Max 级模型。这件事的战略意义大于技术意义。

过去阿里的开源策略是:Max 级闭源 API 商业化,中小模型开源建生态。这次把 Max 级也开源,是在回应 DeepSeek V4Kimi K3 的开源压力——当竞争对手把旗舰模型开源时,Qwen 如果还守着 Max 不放,生态就会被蚕食。

开源的代价是 API 收入减少,收益是生态话语权。阿里选了后者。

局限:几个要冷静的点

开源时间"下周"不是"现在"。 截至发稿,权重还没放出。阿里的开源历史上有过延迟,建议等权重真正上 Hugging Face 再下结论。

16 天自主编程是受控 demo。 真实工程场景的需求变更、依赖冲突、跨系统兼容,远比"从空文件夹写 Agent 框架"复杂。把这个 demo 等同于"AI 能独立当程序员"是过度解读。

原生多模态的具体能力边界未公开。 阿里说"原生视觉理解",但没给出具体的视觉基准成绩(OCR、图表理解、视频理解等)。在 Gemini 3.5 和 GPT-5.6 都已建立多模态基准的背景下,Qwen 这部分的数据缺失是个疑问。

"7 项超越"的基准选择有偏向性。 任何厂商发布时都会挑自己强的基准说事。Terminal-Bench 落后 Sol 2.2 分这个数据,是第三方挖出来的,不是阿里主动宣传的。看跑分要看全维度,不能只看赢的那几项。

行业影响

国产大模型进入"发布密度"竞赛。 8 月第一周,Qwen3.8-Max、DeepSeek-V4-Flash 正式版、OpenAI Astra 接连发布。这种密度意味着模型迭代周期已经从季度压缩到周。对开发者来说是好事——选择更多、价格更低;对厂商来说是坏事——利润空间被快速压缩。

Agent 能力成为新的竞争维度。 Qwen3.8-Max 的 16 天自主编程、OpenAI Astra 的数学证明、GPT-5.6 Sol 的 Terminal-Bench,都在指向同一个方向:模型能力的衡量标准正在从"答题"转向"干活"。跑分时代没有结束,但 Agent 基准的权重在快速上升。

开源 Max 级会成为新常态。 阿里这次开源 Max 权重,会倒逼其他厂商跟进。DeepSeek 已经在 V4 上做了 Apache 2.0 全开源,Kimi K3 也开源了完整权重。当头部玩家都开源旗舰时,闭源 API 的溢价空间会持续被压缩。

结论

Qwen3.8-Max 正式版本身是一个扎实的迭代——2.4 万亿参数、7 项基准超越 GPT-5.6、Max 级首次开源、QwenWork 平台上线。但它不是"国产 AI 全方位超越 OpenAI"的标志,而是在编程、办公、长程 Agent 三个方向上达到了和 GPT-5.6 Sol 同一梯队,部分单项领先,部分单项仍有差距。

真正值得关注的不是 Qwen3.8-Max 本身,而是它代表的趋势:开源旗舰正在从"追赶闭源"变成"和闭源同周发布",Agent 能力正在从"demo"变成"可用工具",AI 模型的竞争维度正在从"跑分"转向"干活"。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板