2026 年 7 月 8 日,xAI 发布了 Grok 4.5——融入 SpaceX、以 600 亿美元收购 Cursor 后的第一个旗舰产品。马斯克将其定位为"Opus 级",声称综合能力与 Claude Opus 4.8 在同一梯队。
但比"Opus 级"这个定性更值得认真看的,是它的定价策略和训练路径。xAI 这次做的事和别人不太一样:它不是想做一个"更好的 Opus",而是想做一个"足够好的 Opus,但便宜得多"。
关键信息
Grok 4.5 基于内部称为 V9 的基础架构,约 1.5T 参数的 MoE 模型,推理速度约 80 TPS。
| 维度 | 值 |
|---|---|
| 架构 | V9 MoE,约 1.5T 总参数 |
| 推理速度 | ~80 TPS |
| 上下文 | 最高 50 万 token(可配置) |
| 定价 | 输入 $2/M token,输出 $6/M token |
| Token 效率 | 约竞品 2 倍 |
| 训练硬件 | 数万张 NVIDIA GB300 |
| 训练数据 | Cursor 真实开发者会话数据 |
| 可用性 | Grok Build / Cursor / xAI API |
对比 Claude Opus 4.8($15/$75),Grok 4.5 的定价低了 5-10 倍。加上约 2 倍的 token 效率——SWE-Bench Pro 上仅用竞品 1/4 的 token 完成同等任务——综合成本可以拉到 10-20 倍。
和 Cursor 的关系:真正的差异化
Grok 4.5 最值得关注的技术细节不是参数规模或基准分数,而是它的训练数据来源。
xAI 在 2026 年 6 月以 600 亿美元估值收购了 Cursor,Grok 4.5 是整合后的第一个产品。Cursor 的真实开发者会话数据——调试追踪、多文件代码差异、用户纠正模式——被直接纳入了训练流程。
这意味着 Grok 4.5 不是在"做题"式基准上训练的。它学习的样本是真实开发者在真实工程场景中的代码编写、调试、修复闭环。这种区别在 benchmark 上不一定看得出来——SWE-Bench 也是构造出来的测试——但在多步编程任务和复杂 Agent 工作流中会更明显。
马斯克在发布时也说了,xAI 收购 Cursor 的目的就是把这种"workflow-aware"的训练能力纳入模型。Grok 4.5 不是 Cursor 的插件,而是反过来——Cursor 是 Grok 4.5 的训练数据管道。
基准:有胜有负
| 基准 | Grok 4.5 | Opus 4.8 | 结果 |
|---|---|---|---|
| DeepSWE 1.0 | ✅ 领先 | 落后 | Grok 胜 |
| Terminal-Bench 2.1 | ✅ 领先 | 落后 | Grok 胜 |
| DeepSWE 1.1 | 落后 | ✅ 领先 | Opus 胜 |
| SWE-Bench Pro | 落后 | ✅ 领先 | Opus 胜 |
| Harvey Legal Agent | 🥇 第一 | — | Grok 胜 |
四场编程基准,两胜两负。Harvey Legal Agent 基准第一名是一个意外结果——主要宣传编程能力的模型,在法律 Agent 上拿了第一。这说明 Grok 4.5 的训练方法在非编程任务上也有不错的泛化能力。
SWE-Bench Pro 上还有一个值得单看的数据:Grok 4.5 平均消耗约 15,954 个输出 token,竞品消耗约 67,020 个。在多步 Agent 场景下,token 效率的优势会直接体现为成本和延迟的降低。
定价策略改变游戏规则
Grok 4.5 真正做对的事情是定价。$2/$6 per M token 加上两倍 token 效率,综合成本不到 Opus 4.8 的十分之一。
对比:
| Grok 4.5 | Opus 4.8 | |
|---|---|---|
| 输入价格 | $2/M | ~$15/M |
| 输出价格 | $6/M | ~$75/M |
| Token 效率 | ~2x | 基线 |
| 综合成本 | ~1/10 | 基线 |
对于需要大量调用编程 API 的团队来说,这个价差直接决定了能不能跑一些原来太贵的场景——比如批量代码审查、大规模的 Agent 工作流、持续集成中的代码分析。
马斯克自己说了一句值得注意的话:
"性能还没到(别尬吹),但其实大多数任务并不需要那么高的性能。"
这是罕见的克制。Grok 4.5 不需要在所有维度上击败 Opus——它只需要在编程和 Agent 任务上做到"够用",然后靠价格优势占领市场。
后续路线
马斯克同时预告了接下来的计划:
- 下周:推出百万上下文版本
- 月底:发布 2T 参数版本
按照 xAI 的节奏,2026 年每个月都会发布一个新模型,Grok 4.5 只是第一弹。
局限
- 欧盟不可用,目前仍有区域限制
- "Opus 级"需要打折扣,四场基准两胜两负,不是全面超越
- Cursor 数据的偏差:模型编程能力偏向 Cursor 用户的使用模式,和常规开发者的实际工作流可能有差异
- 成本优势有条件:高 reasoning effort 模式下 token 消耗可能快速上升,"便宜"是在特定使用模式下的结论
结论
Grok 4.5 是 xAI 至今最具竞争力的产品。它的差异化优势不在于"击败 Opus",而在于以显著更低的成本提供接近 Opus 级别的编程能力。
对 Cursor 用户来说,它是默认集成的,不需要额外配置。对 API 用户来说,$2/$6 的定价让它在编程和 Agent 任务上成为成本最优选之一。但如果你需要经过充分验证、有长期运行记录的通用模型,Opus 4.8 仍然是更稳妥的选择。
- xAI 官网:x.ai
- Grok 4.5 API 控制台:console.x.ai