2026 年 8 月 1 日,OpenAI 官网贴出一篇博客:代号 Astra 的下一代模型,在数学和理论计算机科学领域一口气给出了 10 个开放性问题的解答。不是那种"用 LLM 生成一个看起来像答案的文本"——而是配套 249 页论文、62 页解题思路说明,全部证明用 Lean4 形式化语言编码后开源在 GitHub 上。
整个过程的算力成本,大约 2000 美元。
这件事值得认真看,不是因为它又一次刷新了 AI 的能力上限,而是因为它展示了一种新的科研范式:AI 不再只是辅助工具,而是能独立产出可验证的数学成果。
关键事实
| 维度 | 值 |
|---|---|
| 模型 | Astra(OpenAI 下一代,内部版本) |
| 攻克难题数 | 10 |
| 成果形式 | 249 页论文 + 62 页解题思路 + Lean4 形式化证明 |
| 开源 | GitHub 仓库公开 |
| 算力成本 | 约 $2,000(按 Sol API 费率折算) |
| 难题领域 | 高维几何、编码理论、群论、算子代数、量子复杂度等 |
| 难题难度 | 菲尔兹奖级,部分悬而未决 10 年以上 |
这 10 道题难在哪
OpenAI 没有把所有题目都展开讲,但从公开信息和第三方解读看,几个代表性的方向是这样的:
高维球体堆积问题。这是几何与信息论的核心问题——在 n 维空间里,最多能塞多少个互不重叠的球体?48 年来没人能改进密度上界的理论阈值。Astra 把上界推进到了经典的 Cohn-Elkies 阈值附近,被称作 1978 年以来该方向的首次实质性改进。这个问题看起来抽象,但它直接影响编码理论和通信系统的容量上限。
二进制码与球面码界限优化。和球体堆积同源——如何在球面上排列点,使得任意两点之间的最小距离最大?这是 5G/6G 通信、纠错码设计的数学基础。
群论、算子代数、量子复杂度。这几个方向横跨纯数学和理论计算机科学,具体的题目名称大多对非数学专业读者不友好,但性质是一样的:都是业内公认长期没有进展的开放问题。
这里必须强调一点:这 10 道题的解法不是"看起来对",而是机器可验证的。Lean4 是计算机可全自动核验的证明系统,不存在文字辩论的歧义——证明要么对,要么错,机器说了算。
为什么 $2000 这个数字值得单独说
2000 美元这个数字,比"解出 10 道难题"本身更值得关注。
过去几十年,这类数学难题的进展路径是这样的:一位博士级别的研究者花几年时间钻研一个问题,期间消耗大量的思考、计算、文献检索时间,最终可能——也可能不——产出一篇论文。一个问题的成本,是人力 × 年。
Astra 的成本结构完全不同:它用约 2000 美元的推理算力,同时对 10 个问题发起尝试,每个问题平均 200 美元。这不是"AI 比人聪明",而是"AI 把试错成本压到了一个新量级"——人类数学家不会花 200 美元去赌一个方向是否走得通,但 AI 可以。
这件事的真正含义是:对于"有明确形式化验证标准"的领域,AI 可以用算力换时间,把科研的迭代周期从年压缩到天。
Lean4:为什么形式化是关键
数学证明最怕的不是错,而是"看起来对但其实错"。传统的论文评审机制靠人,人会疲劳、会疏漏、会有偏见。Lean4 这样的形式化证明系统是另一条路——把证明拆解到公理级别,由计算机逐行核验,不存在"我觉得这个步骤是对的"。
OpenAI 把所有证明用 Lean4 编码后开源,这件事的意义在于:
- 结果可复现。任何懂 Lean4 的人都可以下载下来跑一遍,不需要信任 OpenAI。
- 结果可验证。机器核验通过的证明,没有"差不多对"这种状态。
- 方法论可学习。其他研究者可以研究 Astra 是怎么找到这些证明路径的。
这才是 AI 做数学研究应有的姿态:不靠权威背书,靠形式化验证。
局限:不要急着下"AI 已经能当数学家"的结论
冷静看几个问题:
这些题不是"最难"的题。 菲尔兹奖级别的难题很多,Astra 攻克的是其中相对可形式化、可拆解的那一部分。朗兰兹纲领、黎曼猜想这种级别的难题,目前还不在 AI 的射程内。
Astra 还没发布。 这次成果是 OpenAI 主动放出的"科研 demo",目的是展示能力,不是开放使用。普通研究者现在用不到这个模型。
证明软件本身出过错。 有报道指出,OpenAI 在发布过程中 Lean 证明工具曾经报错,后来修复了。这说明 AI 产出的证明仍然需要人工 review + 工具核验的双重保障,不是"AI 说什么就是什么"。
$2000 是"成功成本",不是"全成本"。 AI 可能在 100 个方向上各花 200 美元,其中只有 10 个跑通了。失败的尝试没有被计入。但即便如此,100 × $200 = $20,000 的总成本,仍然远低于一个博士几年的工资。
行业影响
AI 科研范式成立。 这次的真正价值不是 10 道题的答案,而是证明了"AI + 形式化验证"这条路走得通。未来会有更多研究机构和企业把 AI 推向更多需要"可验证正确性"的领域——不只是数学,还有程序验证、协议设计、硬件电路验证。
Lean4 会成为 AI 数学科研的标准工具。 在这之前,Lean4 是数学圈内部的小众工具。OpenAI 这次把它推到了主流视野里。未来 AI 做数学研究的标配会是"模型 + Lean4 + 人工 review"。
OpenAI 在重新定义"模型能力展示"。 过去模型发布靠跑分——LMSYS Arena、SWE-Bench、MMLU。Astra 这次没跑分,直接拿科研成果说话。这是一种更高维度的能力展示:不是"我考试多少分",而是"我做出了什么"。
结论
Astra 的 10 道题,不是又一个"AI 又超越人类了"的营销故事。它是一个清晰的信号:对于有形式化验证标准的科研领域,AI 已经从"辅助工具"升级为"独立研究者"。
2000 美元解 10 道题的经济学,会倒逼整个科研体系重新思考资源分配。当一个 AI 模型可以用 200 美元尝试一个方向,人类数学家的时间应该花在"提出好问题"上,而不是"在已知方法里反复试错"。
这才是这次事件最深层的含义:AI 不是在替代数学家,而是在把数学家从"试错工"解放出来,让他们专注做真正只有人能做的事——提出问题、判断方向、构建理论框架。
- OpenAI 官方博客:Ten advances in mathematics and theoretical computer science
- Lean4 形式化证明仓库:github.com/openai/astra-proofs