跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.08.04 · 11 min

OpenAI Astra:2000 美元算力,10 道人类十年未解的数学题

2026 年 8 月 1 日,OpenAI 尚未发布的下一代模型 Astra 在数学与理论计算机科学领域一次性攻克 10 个悬而未决的难题,覆盖高维球体堆积、编码理论、群论、算子代数、量子复杂度等方向。249 页论文 + Lean4 形式化证明开源,全部算力成本仅约 2000 美元。这不是跑分刷新,是 AI 科研范式的一次实证。

前沿动态

2026 年 8 月 1 日,OpenAI 官网贴出一篇博客:代号 Astra 的下一代模型,在数学和理论计算机科学领域一口气给出了 10 个开放性问题的解答。不是那种"用 LLM 生成一个看起来像答案的文本"——而是配套 249 页论文、62 页解题思路说明,全部证明用 Lean4 形式化语言编码后开源在 GitHub 上。

整个过程的算力成本,大约 2000 美元。

这件事值得认真看,不是因为它又一次刷新了 AI 的能力上限,而是因为它展示了一种新的科研范式:AI 不再只是辅助工具,而是能独立产出可验证的数学成果。

关键事实

维度
模型 Astra(OpenAI 下一代,内部版本)
攻克难题数 10
成果形式 249 页论文 + 62 页解题思路 + Lean4 形式化证明
开源 GitHub 仓库公开
算力成本 约 $2,000(按 Sol API 费率折算)
难题领域 高维几何、编码理论、群论、算子代数、量子复杂度等
难题难度 菲尔兹奖级,部分悬而未决 10 年以上

这 10 道题难在哪

OpenAI 没有把所有题目都展开讲,但从公开信息和第三方解读看,几个代表性的方向是这样的:

高维球体堆积问题。这是几何与信息论的核心问题——在 n 维空间里,最多能塞多少个互不重叠的球体?48 年来没人能改进密度上界的理论阈值。Astra 把上界推进到了经典的 Cohn-Elkies 阈值附近,被称作 1978 年以来该方向的首次实质性改进。这个问题看起来抽象,但它直接影响编码理论和通信系统的容量上限。

二进制码与球面码界限优化。和球体堆积同源——如何在球面上排列点,使得任意两点之间的最小距离最大?这是 5G/6G 通信、纠错码设计的数学基础。

群论、算子代数、量子复杂度。这几个方向横跨纯数学和理论计算机科学,具体的题目名称大多对非数学专业读者不友好,但性质是一样的:都是业内公认长期没有进展的开放问题。

这里必须强调一点:这 10 道题的解法不是"看起来对",而是机器可验证的。Lean4 是计算机可全自动核验的证明系统,不存在文字辩论的歧义——证明要么对,要么错,机器说了算。

为什么 $2000 这个数字值得单独说

2000 美元这个数字,比"解出 10 道难题"本身更值得关注。

过去几十年,这类数学难题的进展路径是这样的:一位博士级别的研究者花几年时间钻研一个问题,期间消耗大量的思考、计算、文献检索时间,最终可能——也可能不——产出一篇论文。一个问题的成本,是人力 × 年。

Astra 的成本结构完全不同:它用约 2000 美元的推理算力,同时对 10 个问题发起尝试,每个问题平均 200 美元。这不是"AI 比人聪明",而是"AI 把试错成本压到了一个新量级"——人类数学家不会花 200 美元去赌一个方向是否走得通,但 AI 可以。

这件事的真正含义是:对于"有明确形式化验证标准"的领域,AI 可以用算力换时间,把科研的迭代周期从年压缩到天。

Lean4:为什么形式化是关键

数学证明最怕的不是错,而是"看起来对但其实错"。传统的论文评审机制靠人,人会疲劳、会疏漏、会有偏见。Lean4 这样的形式化证明系统是另一条路——把证明拆解到公理级别,由计算机逐行核验,不存在"我觉得这个步骤是对的"。

OpenAI 把所有证明用 Lean4 编码后开源,这件事的意义在于:

  1. 结果可复现。任何懂 Lean4 的人都可以下载下来跑一遍,不需要信任 OpenAI。
  2. 结果可验证。机器核验通过的证明,没有"差不多对"这种状态。
  3. 方法论可学习。其他研究者可以研究 Astra 是怎么找到这些证明路径的。

这才是 AI 做数学研究应有的姿态:不靠权威背书,靠形式化验证。

局限:不要急着下"AI 已经能当数学家"的结论

冷静看几个问题:

这些题不是"最难"的题。 菲尔兹奖级别的难题很多,Astra 攻克的是其中相对可形式化、可拆解的那一部分。朗兰兹纲领、黎曼猜想这种级别的难题,目前还不在 AI 的射程内。

Astra 还没发布。 这次成果是 OpenAI 主动放出的"科研 demo",目的是展示能力,不是开放使用。普通研究者现在用不到这个模型。

证明软件本身出过错。 有报道指出,OpenAI 在发布过程中 Lean 证明工具曾经报错,后来修复了。这说明 AI 产出的证明仍然需要人工 review + 工具核验的双重保障,不是"AI 说什么就是什么"。

$2000 是"成功成本",不是"全成本"。 AI 可能在 100 个方向上各花 200 美元,其中只有 10 个跑通了。失败的尝试没有被计入。但即便如此,100 × $200 = $20,000 的总成本,仍然远低于一个博士几年的工资。

行业影响

AI 科研范式成立。 这次的真正价值不是 10 道题的答案,而是证明了"AI + 形式化验证"这条路走得通。未来会有更多研究机构和企业把 AI 推向更多需要"可验证正确性"的领域——不只是数学,还有程序验证、协议设计、硬件电路验证。

Lean4 会成为 AI 数学科研的标准工具。 在这之前,Lean4 是数学圈内部的小众工具。OpenAI 这次把它推到了主流视野里。未来 AI 做数学研究的标配会是"模型 + Lean4 + 人工 review"。

OpenAI 在重新定义"模型能力展示"。 过去模型发布靠跑分——LMSYS Arena、SWE-Bench、MMLU。Astra 这次没跑分,直接拿科研成果说话。这是一种更高维度的能力展示:不是"我考试多少分",而是"我做出了什么"。

结论

Astra 的 10 道题,不是又一个"AI 又超越人类了"的营销故事。它是一个清晰的信号:对于有形式化验证标准的科研领域,AI 已经从"辅助工具"升级为"独立研究者"。

2000 美元解 10 道题的经济学,会倒逼整个科研体系重新思考资源分配。当一个 AI 模型可以用 200 美元尝试一个方向,人类数学家的时间应该花在"提出好问题"上,而不是"在已知方法里反复试错"。

这才是这次事件最深层的含义:AI 不是在替代数学家,而是在把数学家从"试错工"解放出来,让他们专注做真正只有人能做的事——提出问题、判断方向、构建理论框架。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板