8 月 13 日,谷歌正式发布 Gemini 3.7 Flash。距离 3.6 Flash 发布仅过去三周——这不是例行迭代,是 Flash 产品线从"便宜好用"向"跻身旗舰"的实质性跨越。
新模型专为编程和 Agent 工作流打造。在 Artificial Analysis 的 Intelligence Index 中,3.7 Flash(high) 取得 56 分,与 GPT-5.6 Terra(max)、Grok 4.5(high)、Claude Sonnet 5(max) 处于同一区间。Flash 已经不再是"平价替代品"。
三周一更,价格减半,性能追平旗舰。谷歌正在用 Flash 产品线重新定义"性价比"的含义。
性能跃升:从追赶者到并跑者
| 基准 | 3.6 Flash | 3.7 Flash | 提升 |
|---|---|---|---|
| DeepSWE v1.1 | 49.0% | 65.3% | +16.3pp |
| FrontierCode 1.1 Main | 34.4% | 43.6% | +9.2pp |
| WebDev Arena Elo | 1538 | 1588 | +50 |
| GDP.pdf | 22.0% | 34.0% | +12.0pp |
| AutomationBench | 17.0% | 30.4% | +13.4pp |
几个关键数据点:FrontierCode 43.6% 已略高于 Claude Sonnet 5 的 42.7% 和 GPT-5.6 Terra 的 41.3%;WebDev Arena 1588 Elo 超过 Claude Sonnet 5 的 1541 和 GPT-5.6 Terra 的 1523。Flash 已经在部分编程和网页开发测试中和旗舰模型坐到了同一张桌子。
但全面反超远未实现:DeepSWE 65.3% 仍低于 GPT-5.6 Terra 的 69.6%,Terminal-bench 85.8% 逊于后者的 87.4%。Flash 的天花板在快速提高,但天花板仍在。
Agent 能力:从对话到工作流
3.7 Flash 的核心升级不仅在代码,更在 Agent 工作流:
- 多步骤规划:能进行更深入的"思考"链,在工具调用中展现更严谨的逻辑
- 障碍处理:遇到失败时能自动调整策略,而非简单重试
- 意图澄清:必要时主动询问,而非基于错误假设继续执行
- 指令遵循:以更高的忠实度遵循复杂指令,减少人工监督
这些改进直接减少了工程工作流中的重试成本。谷歌的目标很明确:让 Flash 能独立跑完整个 Agent 流程,而非每几步就需要人工干预。
定价策略:年内五折,试探市场弹性
| 项目 | 3.6 Flash 原价 | 3.7 Flash 尝鲜价 | 2027 恢复价 |
|---|---|---|---|
| 输入 | $1.50/M | $0.75/M | $1.50/M |
| 输出 | $7.50/M | $3.75/M | $7.50/M |
截至 2026 年底的五折定价,是谷歌对市场弹性的一次试探。如果开发者因为价格迁移到 Flash 完成日常编程任务,谷歌就能用更低的算力成本维持更高的开发者黏性。反之,如果 3.7 Flash 的能力足以让开发者放弃 Pro 旗舰,那谷歌的"旗舰溢价"策略就需要重新评估。
对比 DeepSeek V4 Flash 的免费策略和 Claude Sonnet 5 的 $10/$50 定价,3.7 Flash 的 $0.75/$3.75 在中间地带找到了自己的位置——比免费模型有谷歌生态的信任背书,比旗舰模型有 5-10 倍的价格优势。
平台接入:从开发者工具到普通用户
3.7 Flash 已同步登陆多个平台:
| 平台 | 接入方式 |
|---|---|
| Gemini App (Spark) | 需 AI Pro 或 Ultra 订阅 |
| Google Antigravity | CLI 与 IDE 工具链 |
| AI Studio | 免费 API 接入 |
| Android Studio | 代码辅助 |
| Gemini Enterprise | 企业级 Agent 平台 |
| Google 搜索 AI Mode | 发布次日接入 |
最值得关注的是 Gemini Spark 的底座切换——从 3.6 Flash 切换到 3.7 Flash。这意味着数百万普通用户无需额外操作,就能体验到编程和 Agent 能力的实质性提升。Spark 用户可以用自然语言跨 Gmail、Google 日历、Google 文档执行多步骤任务。
竞品定位:Flash 的中年危机
2026 年 8 月的编程模型赛道已极度拥挤:
| 模型 | 输入价格 | DeepSWE | 特点 |
|---|---|---|---|
| Gemini 3.7 Flash | $0.75/M | 65.3% | 谷歌生态 + 快速迭代 |
| GPT-5.6 Terra | ~$20/M | 69.6% | 综合能力最强 |
| Claude Sonnet 5 | $10/M | ~60% | 稳定可靠 |
| DeepSeek V4 Flash | 免费 | 54.4% | 开源 + 零成本 |
3.7 Flash 的生存空间在于:谷歌生态的无缝集成 + 远高于开源模型的信任背书 + 仅为闭源旗舰 1/10 到 1/20 的价格。但 DeepSeek V4 Flash 的免费策略和 Claude Sonnet 5 的可靠性口碑,让 Flash 的"性价比高"定位不再无懈可击。
深层意义:Flash 产品线的三个月进化曲线
如果把时间线拉长,Flash 的进化速度更加惊人:
| 时间 | 版本 | DeepSWE | WebDev Elo |
|---|---|---|---|
| 2026.05 | 3.5 Flash | 37.0% | 1506 |
| 2026.07 | 3.6 Flash | 49.0% | 1538 |
| 2026.08 | 3.7 Flash | 65.3% | 1588 |
三个月内 DeepSWE 从 37% 涨到 65.3%,WebDev Elo 从 1506 涨到 1588。这不是渐进式改进,是每三周一次的能力跃升。谷歌将这种速度归功于开发者反馈和算法改进的快速循环——开发者发现问题 → 团队快速迭代 → 三周后新版本上线。
Gemini 3.7 Flash 的意义不在于它现在在排行榜上的位置,而在于它证明了:在 AI 模型竞争中,"快速迭代 + 激定价"的组合拳,能让一个"平价产品线"在短短三个月内逼近旗舰水平。Flash 不再是 Pro 的廉价替代品——它正在成为谷歌 AI 生态的主力。