如果你在网上搜"DeepSeek R2",会看到大量文章报道"R2 正式发布"、"R2 炸裂开源"——参数数字从 131B 到 685B 不等,发布日期从 5 月 5 日到 5 月 31 日各说各话。
这些信息大部分是错的。或者说,它们描述的是一篇从未发生过的发布。
这不是我的判断。打开 DeepSeek 官方的 API 文档,截至 2026 年 7 月 23 日,可用的模型列表是:
deepseek-v4-flashdeepseek-v4-prodeepseek-chat(旧名,将于 7 月 24 日废弃)deepseek-reasoner(旧名,将于 7 月 24 日废弃)
没有 deepseek-r2。 没有 R2 端点,没有 R2 预览,没有 R2 内测。
本文不打算传播又一个 R2 的"参数规格表"。我想做的是:理清 R2 从未发布的真正原因,以及 DeepSeek 实际做了什么替代品。
R2 为什么没发?创始人自己不满意
最可信的消息来源是路透社的报道。据多位知情人士透露,DeepSeek 创始人梁文锋对 R2 的性能不满意,因此从未为其设定发布时间线。
这不是产能问题,不是监管问题,也不是什么"战略延期"。是一个创始人看着自己的作品,觉得不够好,决定不发。
导致 R2 难产的结构性压力是真实的:
- 出口管制切断了 DeepSeek 获取高端 NVIDIA 加速器的途径,压缩了训练吞吐量
- 训练数据的质量和数量被描述为"真正的约束条件",特别是代码生成和非英语推理方面
- 从 R1(2025 年 1 月)到 R2 原定发布窗口之间,DeepSeek 团队扩大了模型规模但未能同时在质量上实现跨越
梁文锋的选择是:不发比发一个失望的东西好。这在今天的 AI 行业里几乎是反直觉的——大部分公司会选择"先发再修"。DeepSeek 没有。
DeepSeek 实际做了什么:V4
在互联网等待 R2 的一年多里,DeepSeek 实际在建造一艘更大的船。
2026 年 4 月 24 日,DeepSeek 正式发布 V4。它不是一个推理模型——它是吸收推理能力的基础模型。
V4-Pro
| 维度 | 数值 |
|---|---|
| 架构 | MoE(混合专家) |
| 总参数 | 1.6 万亿(1.6T) |
| 激活参数 | 49B |
| 上下文窗口 | 100 万 token |
| 推理模式 | 支持 Thinking Mode(非思考/思考切换) |
| 许可证 | MIT(可商用、可修改、可再分发) |
| 训练芯片 | 华为昇腾(Ascend),非 NVIDIA |
| API 价格 | 输入 $0.435/M,输出 $0.87/M |
| 独立评测 | Artificial Analysis 智能指数 44(v4.1) |
几个值得注意的点:
训练在华为昇腾上。 出口管制迫使 DeepSeek 切断了 NVIDIA 依赖,V4 是在华为 Ascend 芯片上完成训练的。如果你还记得 2023-2024 年关于"中国 AI 被芯片卡脖子"的讨论——V4 用实际产品回应了这个问题:瓶颈是效率,不是芯片。
MIT 许可,权重开源。 1.6T 参数的模型权重公开可下载,MIT 许可意味着真正的商用自由,不需要申请、不需要报备。
定价延续了 R1 的破坏性。 0.435/0.87 这个价格原本是 75% 的促销折扣,然后 DeepSeek 直接把它变成了永久定价。对比 Claude Opus 4.8 的 $15/$75,V4-Pro 的成本低了 30-50 倍。
V4-Flash
V4-Flash 是 V4-Pro 的小弟,更小、更快、更便宜。同样支持 Thinking Mode,同样 MIT 许可。
有趣的是,deepseek-chat 和 deepseek-reasoner 这两个旧名现在分别映射到 V4-Flash 的非思考和思考模式。也就是说,如果你 2026 年上半年一直用 DeepSeek 的"推理模式",你其实已经在用 V4-Flash 了,只是名字没改过来。
DSpark
2026 年 6 月底,DeepSeek 又发布了 DSpark——一个 MIT 许可的开源推测解码框架。它的机制是用一个小模型先"草拟"token,大模型批量验证,而不是逐 token 生成。
DeepSeek 报告 V4-Flash 在启用 DSpark 后,单用户生成速度提升了 60-85%。
所以 R2 到底怎么回事?
我的理解是这样的:
DeepSeek 原来的计划确实是发布 R2——一个专注于推理的模型,延续 R1 的路线。但训练过程中发现了两个问题:
-
纯推理模型的路越来越窄。 2025-2026 年,所有主流模型(GPT、Claude、Gemini)都在把推理能力内建到基础模型中。单独的推理模型存在的意义在被稀释。
-
V4 的基础够强。 V4 在训练过程中展现出了足够的推理能力,让团队决定与其分叉出一个 R2,不如把推理直接放进 V4 作为模式切换。
结果是:R2 消失了,但它的能力被 V4 吸收了。V4 的 Thinking Mode 就是原来的 R2。
这是否算"R2 发布了"取决于你怎么定义。但严谨地说——DeepSeek 从未发布过一个叫 "R2" 的模型。社区流传的那些参数规格,全部来自推测和自媒体。
开源大模型格局的三个关键趋势
V4 的故事不是孤立的。把它和 Llama 4、Qwen 3.6 放在一起看,能看清 2026 年开源大模型的几个趋势:
-
许可证在变松。 DeepSeek V4 是 MIT、Llama 4 是带 MAU 上限的宽松许可、Qwen 3 全系 Apache 2.0。三年前"开源模型"还是个有争议的概念,2026 年这已经变成竞争基线。
-
训练硬件的依赖在松动。 V4 在华为昇腾上完成训练,证明了算法效率可以补偿硬件差距。这地缘政治上是个大事,技术上也是。
-
推理能力被内建。 R2 没有独立存在,因为它的价值被 V4 吸收了。Qwen 3.5/3.6 也支持思考/非思考模式切换。单独的"推理模型"这个品类正在消失。
- DeepSeek API 文档:api-docs.deepseek.com
- DeepSeek V4 公告:deepseek.com
- Reuters:DeepSeek R2 未设定发布时间线