阿里巴巴的 Qwen 系列在 2026 年的迭代速度非常快:从 Qwen 3(2025 年 4 月)到 Qwen 3.5(2026 年 2 月),再到 Qwen 3.6(2026 年 4 月)——一年一个大版本变成了几乎一个季度一次。
但 Qwen 3.6 的意义不在迭代速度,而在于它做了一个反直觉的决定:在大家疯狂堆 MoE 专家的时代,推了一个 27B 的稠密(Dense)模型,然后在代码能力上打败了自家 397B 的 MoE 旗舰。
同时 2026 年 5 月,Qwen 4 Preview(32B-A3B)已经在 LLMCheck 的开源本地榜单上冲到第一。阿里在开源大模型这个赛道上,正在从"跟跑"变成"最难忽视的那一家"。
Qwen 系列的演化
先理清时间线,因为这个系列确实有点乱了:
| 版本 | 时间 | 旗舰模型 | 架构 | 亮点 |
|---|---|---|---|---|
| Qwen 3 | 2025.04 | 235B-A22B MoE | MoE | 思考/非思考模式切换首秀 |
| Qwen 3.5 | 2026.02 | 397B-A17B MoE | MoE | 原生视觉 + 201 语言 |
| Qwen 3.6 | 2026.04 | 27B Dense | 混合注意力 | SWE-bench 77.2%,打败旗舰 |
| Qwen 3.7-Max | 预览中 | — | — | 100 万 token 上下文 |
| Qwen 4 Preview | 2026.05 | 32B-A3B | MoE | LLMCheck 开源本地榜 #1 |
Qwen 3.6:最反常也最有意思的一个
Qwen 3.5 的旗舰是 397B(总参数)/ 17B(激活参数)的 MoE,原生支持视觉和多语言。按常规剧本,Qwen 3.6 应该是一个更大的 MoE。
但阿里选了另一条路:一个 27B 的稠密模型,用混合注意力架构来打代码场景。
架构:Gated DeltaNet + 传统自注意力
这可能是 Qwen 3.6 最值得关注的技术细节。
Transformer 的注意力机制有一个众所周知的问题:随着序列变长,计算量呈平方级增长。各种"线性注意力"方案试图解决这个问题,但通常在某些任务上会牺牲质量。
Qwen 3.6 采用了一种混合方案:
- Gated DeltaNet(线性注意力):处理长序列中的大部分 token,效率高、内存友好
- 传统自注意力(Softmax Attention):保留在关键位置,确保推理质量
这两种机制在每一层中混合使用,而不是分成"部分层用 A、部分层用 B"。这使得模型在长序列代码推理和标准 NLP 任务上都能保持竞争力,同时把参数量控制在 27B。
基准表现
| 基准 | Qwen 3.6-27B | Qwen 3.5-397B-A17B | 对比 |
|---|---|---|---|
| SWE-bench Verified | 77.2% | 76.2% | 27B > 397B |
| SWE-bench Pro | 53.5% | 50.9% | 27B > 397B |
| Terminal-Bench 2.0 | 59.3% | 52.5% | 27B > 397B |
一个 27B 的稠密模型在代码基准上全面超越了一个 397B 的 MoE 模型——这不是参数的胜利,是架构选择和训练策略的胜利。
Thinking Preservation
Qwen 3.6 还引入了一个在 Agent 场景中非常实用的特性:Thinking Preservation(跨轮推理保留)。
之前的思考模式在每一轮对话中都是"各自为政"的——模型会单独思考当前这一轮的输入,不会利用上一轮的推理上下文。在单次问答中这没问题,但在多步 Agent 工作流中,信息断层会导致效率低下。
Thinking Preservation 让 Agent 在跨轮推理中保留了思维链路。阿里的官方表述比较克制,但社区测试显示,在涉及多步工具调用、代码编写-调试循环的场景中,这个特性有明显效果。
Qwen 4 Preview:开源本地榜登顶
2026 年 5 月,阿里又发布了 Qwen 4 Preview(32B-A3B)。看起来像个"增量更新",但 LLMCheck 将其评为当前开源本地可部署模型榜单的第一名(73/100 分)。
核心指标:
- SWE-Verified:76%
- MMLU:88%
- HumanEval:92%
- AIME(数学竞赛):89%
- 24GB Mac(Q4 量化)可运行
- 推理速度:M4 Pro 上 58-78 tok/s
相比上一代 Qwen 3.6-35B-A3B,它改进了混合推理模式——不再需要手动切换思考/非思考模式,Qwen 4 Preview 会自动判断任务的复杂度,对简单问题快速回答,对复杂问题启动 Thinking Mode。
许可证依然是 Apache 2.0。
阿里的开源策略
以 Apache 2.0 许可开源所有模型,这个策略在 2026 年显得越来越有先见之明:
- Meta 的 Llama 4 用的是自家宽松许可(有 MAU 上限条款),OSI 不承认这是开源
- Google 的 Gemma 4 就更宽松了——它甚至不是 open-weight 许可证,而是有使用限制的自定义许可
- Microsoft 的 Phi-4 是 MIT,但微软没有训练任何接近前沿规模的模型
- DeepSeek 的 V4 是 MIT,但不支持多模态
阿里在开源策略上是所有大公司里最一致的一个:从 Qwen 1 到 Qwen 4 Preview,全部 Apache 2.0,全部公开权重,从 0.6B 到 400B+ 全覆盖。这个策略的直接结果是:2026 年,Qwen 衍生模型数超过 10 万个,全球下载量超 3 亿次,超越了 Llama 成为全球第一开源模型家族。
当然,阿里做开源不是做慈善。Qwen 的强大免费版本为阿里云的 API 服务(DashScope)做了最好的引流——你有权力自己部署模型,但如果你不想管基础设施,可以用 API。这是一种比"限制开源版本、卖付费版"更聪明的策略。
小结
Qwen 3.6 告诉我们:在开源大模型的竞争中,参数规模和架构类型不是胜负手,架构效率和训练策略才是。 27B 的稠密模型能在代码上打过 397B 的 MoE,这不是"参数膨胀竞赛"能解释的。
而 Qwen 的 Apache 2.0 全线开源策略,正在从根本上改变开发者对大模型的选择逻辑:当你可以下载一个有竞争力的前沿模型、自己部署、商用无限制的时候,"为什么还要用闭源 API"这个问题会越来越难回答。
- Qwen 官方:qwen.ai
- Qwen 3.6 发布公告:qwen.ai/blog
- LLMCheck 榜单:llmcheck.net