跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.07.20 · 10 min

Qwen 3.8 Max 突袭:2.4 万亿参数,阿里把「思考」变成了默认档位

2026 年 7 月 19 日,阿里千问 PC 端接入 Qwen3.8-Max-Preview,2.4 万亿参数 MoE 架构,1M 上下文,三档思考强度(low/high/xhigh),推理不可关闭。代码工程、数据分析、长程 Agent 是核心场景。

前沿动态

7 月 19 日,没有发布会,没有技术报告,阿里千问 PC 端静默接入了一个新模型:Qwen3.8-Max-Preview。2.4 万亿参数,MoE 架构,1M 上下文窗口,三档思考强度——然后就这么上线了。

这种「突袭式发布」在千问的产品节奏里并不罕见。但 2.4T 的参数规模意味着一件事:国产大模型正式进入 2T+ 时代。上一代 Qwen 3.7 Plus 的参数规模尚未公开,而 3.8 Max 直接把天花板拉到了 2.4 万亿。

当参数量不再是秘密武器,「怎么用」比「有多大」更重要。Qwen 3.8 Max 的答案是:让思考成为不可关闭的默认档。

核心规格

Qwen3.8-Max-Preview 的已公开参数如下:

维度 Qwen3.8-Max-Preview
总参数量 2.4 万亿(2.4T)
架构 MoE(激活参数未公开)
上下文窗口 ~1M tokens(983,616)
最大输出 256K tokens
输入模态 文本、图像、视频
输出模态 文本
思考强度 low / high / xhigh(默认 Extra-High)
推理开关 不可关闭
默认思考预算 ~131,072 tokens
开源状态 不开源
发布日期 2026 年 7 月 19 日(Preview)

两个设计决策值得注意:推理不可关闭,以及默认思考强度为 Extra-High。这意味着每一次调用都会经历完整的推理链——没有「快速但浅层」的选项。

三档思考:不是可选,是必选

Qwen 3.8 Max 的思考机制分三档:

档位 思考预算 适用场景
low 较少 token 简单问答、格式转换
high 中等 token 代码生成、数据分析
xhigh(默认) ~131K tokens 复杂推理、长程 Agent、跨文件工程

腾讯 Hy3 的「快慢思考融合」不同,Qwen 3.8 Max 没有 no_think 选项。Hy3 允许完全关闭思考(直觉式响应),Qwen 3.8 Max 强制所有请求经过推理链。

这个设计的代价是延迟和 token 消耗——多轮对话需要回传 reasoning_content,并计入输入 tokens。但收益是输出质量的稳定性:不会出现「这次答对了下次答错了」的随机波动。

对开发者来说,这意味着 API 调用成本的可预测性提高了,但单次调用的最低消费也提高了。简单问答场景下,Hy3 的 no_think 模式成本更低;复杂任务场景下,Qwen 3.8 Max 的强制深度思考可能一次到位,减少重试。

核心场景:代码、数据、Agent

官方对 Qwen 3.8 Max 的定位不是「通用聊天模型」,而是三个垂直场景的强化:

大型代码库处理。相较 Qwen3.7-Max,3.8 Max 强化了跨文件修改和全库理解能力。1M 上下文意味着可以一次性装入中型项目的核心代码。在 Qoder CN IDE 中,这个模型已经作为可选模型上线。

复杂数据分析。不只是「帮我写个 SQL」,而是多步骤的数据清洗、统计建模、可视化生成的端到端执行。

长程 Agent 任务。多步骤任务执行是 3.8 Max 的重点优化方向。配合 QoderWork CN 等桌面智能体产品,可以执行需要数十步推理的复杂工作流。

这三个场景的共同特征是:需要深度思考,对延迟不敏感,对准确性要求极高。这解释了为什么阿里选择「推理不可关闭」的设计——在这些场景里,浅层响应的错误成本远高于多花几秒思考。

与上一代和竞品的对比

维度 Qwen3.8-Max Qwen3.7-Max Hy3 正式版 GLM-5.2
总参数 2.4T 未公开 295B 744B
上下文 ~1M 较短 256K 1M
推理机制 强制三档 可选 快慢融合(可关闭) 异步 Agent RL
开源 是(MIT)
多模态 文本+图像+视频 文本为主 文本为主 文本为主

2.4T 参数让 Qwen 3.8 Max 在规模上碾压所有国产竞品。但参数量不等于能力——Hy3 用 295B 在 SWE-bench 上拿到 74.4%,GLM-5.2 用 744B 在编程实战中摸到第一梯队。Qwen 3.8 Max 的 Preview 版本尚未公开基准测试成绩,实际能力有待验证。

值得注意的是开源维度的差异。Hy3 和 GLM-5.2 都已开源,Qwen 3.8 Max 明确不开源。对于需要私有化部署的企业用户,这是一个硬性约束。

可用性与接入方式

Qwen3.8-Max-Preview 当前的接入方式:

渠道 状态 说明
千问 PC 端 已上线 默认模型已切换
阿里云 Token Plan 已上线 按量计费
Qoder CN 生态 已上线 IDE/CLI/桌面端可选
公开 API 定价 未公布 Preview 阶段
开源权重 不提供 明确不开源

推理不能关闭意味着 API 调用时,reasoning_content 会随响应返回,多轮对话需回传并计入输入 tokens。开发者在估算成本时需要将思考 token 纳入预算。

2.4T 的意义:规模竞赛还是工程选择

2.4 万亿参数是一个信号,但不是一个结论。

从工程角度看,MoE 架构下 2.4T 总参数并不意味着每次推理都激活全部参数。激活参数未公开,但参考同架构竞品(Hy3 为 295B/21B 激活,GLM-5.2 为 744B/40B 激活),Qwen 3.8 Max 的激活参数大概率在百亿到百亿级。实际推理成本取决于激活参数,而非总参数。

从市场角度看,2.4T 是一个「不可忽略」的数字。在 Claude Fable 5 被禁、国产模型集体冲刺的背景下,参数量仍然是最直观的竞争力指标。但真正决定用户留存的,是代码补全的准确率、Agent 任务的完成率、数据分析的可靠性——这些数字要等正式版发布后才能验证。

写在最后

Qwen 3.8 Max Preview 的突袭式发布,透露了阿里在模型层的策略转变:不再追求「发布即巅峰」的营销节奏,而是用 Preview 快速收集反馈、迭代优化。「推理不可关闭」的设计则表明,阿里认为深度思考不是可选项,而是下一代模型的标配。

2.4T 参数是入场券,不是奖杯。Qwen 3.8 Max 真正需要证明的,不是「我有多大」,而是「在 1M 上下文里跑完一个完整工程任务时,我比 295B 的 Hy3 强多少」。

对 Qoder 生态的影响

Qwen 3.8 Max 的发布对阿里自家的 Qoder CN 系列 产品有直接拉动作用。作为模型选择器中的新选项,2.4T 参数和 1M 上下文让 Qoder CN IDE 在处理大型代码库时有了质的提升空间。

具体来看,1M 上下文意味着什么:一个中型项目(约 500 个文件、10 万行代码)的核心代码可以一次性装入上下文窗口。Agent 不再需要「看一个文件猜一个文件」,而是真正理解整个工程的架构和依赖关系。

对于 QoderWork CN 用户,Qwen 3.8 Max 的多模态能力(文本+图像+视频输入)意味着可以直接上传截图、图表、甚至录屏来描述需求。这在数据分析和 PPT 生成场景中尤其实用——拍一张白板上的思维导图,直接生成结构化的项目方案。

但需要注意的是,Preview 版本的 API 定价尚未公布。考虑到 2.4T 参数的推理成本和强制思考机制带来的额外 token 消耗,正式版的定价大概率高于当前千问系列的其他模型。对于成本敏感的开发者,在简单任务上继续使用 Qwen 3.7 系列或切换到 DeepSeek 仍然是更经济的选择。

开源阵营的压力

Qwen 3.8 Max 明确不开源,这在当前国产模型的开源浪潮中显得格格不入。Hy3 正式版 开源到四个平台,GLM-5.2 采用 MIT 协议——开发者可以免费下载、私有化部署、自由微调。

不开源意味着:企业无法私有化部署 Qwen 3.8 Max,无法对其进行领域微调,无法在断网环境中使用。对于金融、政务、军工等有硬性合规要求的行业,这是一个无法绕过的限制。

阿里的策略可能是:用不开源保护商业壁垒,用 Qoder CN 生态(IDE + 桌面 + CLI)作为分发渠道,让开发者通过产品而非模型本身来使用 Qwen 3.8 Max 的能力。这是一条与开源社区完全不同的路——卖服务而非卖权重。

但风险也很明显:当 Hy3 和 GLM-5.2 的开源版本已经「够用」时,开发者为什么要为不开源的 Qwen 3.8 Max 付费?答案只能来自实际能力的代差——如果 2.4T 参数带来的不是 10% 的提升而是 50% 的提升,付费就有道理。Preview 阶段无法验证这一点,需要等正式版和公开基准测试。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板