7 月 19 日,没有发布会,没有技术报告,阿里千问 PC 端静默接入了一个新模型:Qwen3.8-Max-Preview。2.4 万亿参数,MoE 架构,1M 上下文窗口,三档思考强度——然后就这么上线了。
这种「突袭式发布」在千问的产品节奏里并不罕见。但 2.4T 的参数规模意味着一件事:国产大模型正式进入 2T+ 时代。上一代 Qwen 3.7 Plus 的参数规模尚未公开,而 3.8 Max 直接把天花板拉到了 2.4 万亿。
当参数量不再是秘密武器,「怎么用」比「有多大」更重要。Qwen 3.8 Max 的答案是:让思考成为不可关闭的默认档。
核心规格
Qwen3.8-Max-Preview 的已公开参数如下:
| 维度 | Qwen3.8-Max-Preview |
|---|---|
| 总参数量 | 2.4 万亿(2.4T) |
| 架构 | MoE(激活参数未公开) |
| 上下文窗口 | ~1M tokens(983,616) |
| 最大输出 | 256K tokens |
| 输入模态 | 文本、图像、视频 |
| 输出模态 | 文本 |
| 思考强度 | low / high / xhigh(默认 Extra-High) |
| 推理开关 | 不可关闭 |
| 默认思考预算 | ~131,072 tokens |
| 开源状态 | 不开源 |
| 发布日期 | 2026 年 7 月 19 日(Preview) |
两个设计决策值得注意:推理不可关闭,以及默认思考强度为 Extra-High。这意味着每一次调用都会经历完整的推理链——没有「快速但浅层」的选项。
三档思考:不是可选,是必选
Qwen 3.8 Max 的思考机制分三档:
| 档位 | 思考预算 | 适用场景 |
|---|---|---|
| low | 较少 token | 简单问答、格式转换 |
| high | 中等 token | 代码生成、数据分析 |
| xhigh(默认) | ~131K tokens | 复杂推理、长程 Agent、跨文件工程 |
与 腾讯 Hy3 的「快慢思考融合」不同,Qwen 3.8 Max 没有 no_think 选项。Hy3 允许完全关闭思考(直觉式响应),Qwen 3.8 Max 强制所有请求经过推理链。
这个设计的代价是延迟和 token 消耗——多轮对话需要回传 reasoning_content,并计入输入 tokens。但收益是输出质量的稳定性:不会出现「这次答对了下次答错了」的随机波动。
对开发者来说,这意味着 API 调用成本的可预测性提高了,但单次调用的最低消费也提高了。简单问答场景下,Hy3 的 no_think 模式成本更低;复杂任务场景下,Qwen 3.8 Max 的强制深度思考可能一次到位,减少重试。
核心场景:代码、数据、Agent
官方对 Qwen 3.8 Max 的定位不是「通用聊天模型」,而是三个垂直场景的强化:
大型代码库处理。相较 Qwen3.7-Max,3.8 Max 强化了跨文件修改和全库理解能力。1M 上下文意味着可以一次性装入中型项目的核心代码。在 Qoder CN IDE 中,这个模型已经作为可选模型上线。
复杂数据分析。不只是「帮我写个 SQL」,而是多步骤的数据清洗、统计建模、可视化生成的端到端执行。
长程 Agent 任务。多步骤任务执行是 3.8 Max 的重点优化方向。配合 QoderWork CN 等桌面智能体产品,可以执行需要数十步推理的复杂工作流。
这三个场景的共同特征是:需要深度思考,对延迟不敏感,对准确性要求极高。这解释了为什么阿里选择「推理不可关闭」的设计——在这些场景里,浅层响应的错误成本远高于多花几秒思考。
与上一代和竞品的对比
| 维度 | Qwen3.8-Max | Qwen3.7-Max | Hy3 正式版 | GLM-5.2 |
|---|---|---|---|---|
| 总参数 | 2.4T | 未公开 | 295B | 744B |
| 上下文 | ~1M | 较短 | 256K | 1M |
| 推理机制 | 强制三档 | 可选 | 快慢融合(可关闭) | 异步 Agent RL |
| 开源 | 否 | 否 | 是 | 是(MIT) |
| 多模态 | 文本+图像+视频 | 文本为主 | 文本为主 | 文本为主 |
2.4T 参数让 Qwen 3.8 Max 在规模上碾压所有国产竞品。但参数量不等于能力——Hy3 用 295B 在 SWE-bench 上拿到 74.4%,GLM-5.2 用 744B 在编程实战中摸到第一梯队。Qwen 3.8 Max 的 Preview 版本尚未公开基准测试成绩,实际能力有待验证。
值得注意的是开源维度的差异。Hy3 和 GLM-5.2 都已开源,Qwen 3.8 Max 明确不开源。对于需要私有化部署的企业用户,这是一个硬性约束。
可用性与接入方式
Qwen3.8-Max-Preview 当前的接入方式:
| 渠道 | 状态 | 说明 |
|---|---|---|
| 千问 PC 端 | 已上线 | 默认模型已切换 |
| 阿里云 Token Plan | 已上线 | 按量计费 |
| Qoder CN 生态 | 已上线 | IDE/CLI/桌面端可选 |
| 公开 API 定价 | 未公布 | Preview 阶段 |
| 开源权重 | 不提供 | 明确不开源 |
推理不能关闭意味着 API 调用时,reasoning_content 会随响应返回,多轮对话需回传并计入输入 tokens。开发者在估算成本时需要将思考 token 纳入预算。
2.4T 的意义:规模竞赛还是工程选择
2.4 万亿参数是一个信号,但不是一个结论。
从工程角度看,MoE 架构下 2.4T 总参数并不意味着每次推理都激活全部参数。激活参数未公开,但参考同架构竞品(Hy3 为 295B/21B 激活,GLM-5.2 为 744B/40B 激活),Qwen 3.8 Max 的激活参数大概率在百亿到百亿级。实际推理成本取决于激活参数,而非总参数。
从市场角度看,2.4T 是一个「不可忽略」的数字。在 Claude Fable 5 被禁、国产模型集体冲刺的背景下,参数量仍然是最直观的竞争力指标。但真正决定用户留存的,是代码补全的准确率、Agent 任务的完成率、数据分析的可靠性——这些数字要等正式版发布后才能验证。
写在最后
Qwen 3.8 Max Preview 的突袭式发布,透露了阿里在模型层的策略转变:不再追求「发布即巅峰」的营销节奏,而是用 Preview 快速收集反馈、迭代优化。「推理不可关闭」的设计则表明,阿里认为深度思考不是可选项,而是下一代模型的标配。
2.4T 参数是入场券,不是奖杯。Qwen 3.8 Max 真正需要证明的,不是「我有多大」,而是「在 1M 上下文里跑完一个完整工程任务时,我比 295B 的 Hy3 强多少」。
对 Qoder 生态的影响
Qwen 3.8 Max 的发布对阿里自家的 Qoder CN 系列 产品有直接拉动作用。作为模型选择器中的新选项,2.4T 参数和 1M 上下文让 Qoder CN IDE 在处理大型代码库时有了质的提升空间。
具体来看,1M 上下文意味着什么:一个中型项目(约 500 个文件、10 万行代码)的核心代码可以一次性装入上下文窗口。Agent 不再需要「看一个文件猜一个文件」,而是真正理解整个工程的架构和依赖关系。
对于 QoderWork CN 用户,Qwen 3.8 Max 的多模态能力(文本+图像+视频输入)意味着可以直接上传截图、图表、甚至录屏来描述需求。这在数据分析和 PPT 生成场景中尤其实用——拍一张白板上的思维导图,直接生成结构化的项目方案。
但需要注意的是,Preview 版本的 API 定价尚未公布。考虑到 2.4T 参数的推理成本和强制思考机制带来的额外 token 消耗,正式版的定价大概率高于当前千问系列的其他模型。对于成本敏感的开发者,在简单任务上继续使用 Qwen 3.7 系列或切换到 DeepSeek 仍然是更经济的选择。
开源阵营的压力
Qwen 3.8 Max 明确不开源,这在当前国产模型的开源浪潮中显得格格不入。Hy3 正式版 开源到四个平台,GLM-5.2 采用 MIT 协议——开发者可以免费下载、私有化部署、自由微调。
不开源意味着:企业无法私有化部署 Qwen 3.8 Max,无法对其进行领域微调,无法在断网环境中使用。对于金融、政务、军工等有硬性合规要求的行业,这是一个无法绕过的限制。
阿里的策略可能是:用不开源保护商业壁垒,用 Qoder CN 生态(IDE + 桌面 + CLI)作为分发渠道,让开发者通过产品而非模型本身来使用 Qwen 3.8 Max 的能力。这是一条与开源社区完全不同的路——卖服务而非卖权重。
但风险也很明显:当 Hy3 和 GLM-5.2 的开源版本已经「够用」时,开发者为什么要为不开源的 Qwen 3.8 Max 付费?答案只能来自实际能力的代差——如果 2.4T 参数带来的不是 10% 的提升而是 50% 的提升,付费就有道理。Preview 阶段无法验证这一点,需要等正式版和公开基准测试。