page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

AI能写证明之后,为什么读懂证明的人反而更稀缺了

mogoec 2026-08-06 11

前几天,我连续刷到几条几乎一模一样的消息。

“OpenAI内部神秘模型Astra,一口气解决10个长期未解数学难题。”

“总成本只花了2000美元。”

“人类数学家可能真的要失业了。”

第一次看到时,我也愣了一下。

10个长期未解问题。

2000美元。

平均一个问题200美元。

这几个数字放在一起,实在太有冲击力了。

在很多短视频的描述里,整件事就像一场数学界的“横扫”。

OpenAI拿出一张特殊试卷,上面写着十道人类几十年都没有做出来的大题。

神秘模型Astra坐下来,思考了一会儿。

然后,“啪”的一声,把十份完整答案拍在桌上。

最后,系统弹出账单:

2000美元。

这个画面极其容易理解,也极其容易传播。

但我认真看完OpenAI发布的原始材料后,发现事情并不是这样。

准确地说,网络上流传最广的那个版本,把几个完全不同的概念压缩成了一句话。

而压缩掉的部分,恰恰比“AI解决十道题”更加重要。

因为这件事真正预示的,并不是AI突然变成了数学之神。

而是人类知识生产的瓶颈,正在发生一次根本性的转移。

被传播标题吃掉的两个字

OpenAI在2026年8月1日发布的原文,标题是《数学与理论计算机科学的十项进展》。

官方对于这十项结果的表述非常谨慎:

每一项成果,都“解决了一个长期开放问题,或者在该问题上取得了实质性进展”。

请注意中间的两个字:

或者。

就是这两个字,在大量二次传播中消失了。

“解决十个长期难题”和“解决或推进十个长期开放问题”,听起来非常接近,实际含义却差得很远。

因为这十项成果根本不是十道规格相同的数学题。

有些成果证明了一条完整定理。

有些成果给出了一个反例,直接推翻了原来的猜想。

有些成果改善了一个几十年没有变化的数学边界。

还有一些成果,解决的是一个关键子问题,而不是整个研究方向的终极问题。

把它们全部翻译成“解决十道数学难题”,就像把登顶珠峰、发现一条新登山路线、刷新海拔纪录和证明某条路线无法通行,全部概括成“爬完了四座山”。

不能说完全错误。

但理解一定会被带偏。

没有解决整个球填充问题,也依然可能是重大突破

我觉得最能说明问题的,是高维球填充。

所谓球填充,可以简单理解成:怎样把很多同样大小的球放进一个空间,让它们尽可能紧密,同时又不能互相重叠。

在二维空间里,它有点像把一堆硬币摆在桌面上。

在三维空间里,它有点像把橙子堆进箱子。

可一旦维度增加到几十维、几百维,问题就不再能靠直觉理解。

Astra并没有直接给出“所有高维空间中球应该怎样排列才最密”的最终答案。

它完成的是另一件事:

改进高维球填充密度的一般渐近上界,并确定一种重要方法能够达到的极限。

OpenAI发布的论文称,这是自1978年以来,高维一般球填充指数上界的首次改进。

这当然是一项重大进展。

但它不等于“整个高维球填充问题已经被彻底解决”。

这也是为什么,阅读AI研究新闻时,我越来越警惕“解决”这个词。

在普通人的理解里,解决往往意味着:

问题结束了。

答案出来了。

以后不用研究了。

可在科学研究中,解决一个子问题、推翻一个猜想、改进一个上界、确定一种方法的能力极限,都可能被视为真正的研究成果。

科学并不是一张只有标准答案的试卷。

它更像一片没有完整地图的大陆。

有人找到终点。

有人修了一座桥。

有人证明前方是悬崖。

这些都叫进展。

“只是找到一个反例”,可能已经一锤定音

很多人还会低估反例的价值。

比如一个猜想说:

“所有天鹅都是白色的。”

要证明它成立,你可能需要检查世界上的每一只天鹅。

但要证明它错误,只需要找到一只黑天鹅。

这就是反例。

所以,当AI找到一个反例时,并不意味着“任务只完成了一半”。

对于某些数学猜想来说,一个有效反例就已经足以彻底终结原命题。

OpenAI公布的十项成果中,就包括对Connes刚性猜想以及极值图论中部分猜想的反例或否证结果。

不过,推翻一个猜想和建立一套全新的理论体系,仍然是两种不同的研究能力。

前者证明旧路走不通。

后者还要告诉我们,新路在哪里。

所以,更准确的说法不是“Astra一次性完成十道同级别数学题”。

而是:

同一个内部模型,在多个数学与理论计算机科学领域中,批量产生了不同类型的研究级候选成果。

我认为,这才是整件事最值得关注的部分。

2000美元是真的,但不是你以为的那张账单

接下来,我们再看那个传播力最强的数字:

2000美元。

OpenAI的原文是,这些问题在“寻找解法”阶段所消耗的token,如果按照Sol API的价格进行折算,总计大约价值2000美元。

真正执行研究任务的是尚未公开的内部版本Astra。

Sol只是计算价格时使用的标尺。

因此,2000美元并不是一个凭空编出来的数字。

但它是一个范围非常窄的数字。

它更像是电影完成渲染后的一张算力小票,而不是整部电影的制作总账。

至少有几类成本没有被这个数字完整覆盖:

Astra本身的训练成本没有算进去。

问题由谁选择、为什么选择,没有算进去。

一共尝试过多少问题,没有公开。

走过多少条失败路线,也没有公开。

后续整理手稿、形式化证明和专家审查,同样不能简单塞进这2000美元里。

这就产生了一个非常关键的“分母问题”。

假如模型只尝试了10个问题,成功了10个,那是一种能力。

假如模型尝试了100个问题,成功了10个,是另一种能力。

假如模型扫描了10000个问题,最后挑出10个最成功的案例,又是完全不同的一种能力。

目前公开材料披露了成功结果,却没有给出完整的问题池规模和失败搜索成本。

因此,我们不能从2000美元直接推出:

“AI解决一道开放数学问题只需要200美元。”

能确定的只有一件事:

在这批成功案例中,生成候选论证所消耗的token,按公开API价格折算已经非常便宜。

候选答案越来越便宜。

但选题、筛选、试错、验证和责任,并没有因此消失。

真正的跨越,不是从银牌到金牌

要理解这次变化,我们还要回到数学竞赛。

2024年,Google DeepMind的数学系统在国际数学奥林匹克竞赛题目上达到了银牌水平。

2025年,Google和OpenAI的实验系统都达到了金牌分数线,能够解决六道题中的五道。

这是非常强的进步。

但奥数再难,本质上仍然是一场考试。

考试具有几个重要条件:

题目已经被确定。

出题人知道问题可以解决。

参赛者知道题目大概率存在可在规定时间内完成的解法。

评委手里还有评分标准。

也就是说,AI面对的是一个边界已经画好的迷宫。

出口很难找。

但人类知道出口存在。

开放数学问题完全不同。

一个问题之所以长期开放,意味着人类可能不知道答案是什么,不知道原猜想是真是假,甚至不知道现有数学工具是否足以处理它。

这里没有标准答案。

没有现成评分表。

有时连“这个结果算不算重大进展”,都需要一个领域经过讨论后才能形成共识。

因此,Astra最值得关注的变化,不是把考试分数从银牌刷到了金牌。

而是模型开始尝试交付:

没有答案本、需要同行判断、可能产生新知识的研究结果。

从“解题模型”到“研究参与者”,中间隔着的就是这一步。

它不是一场神秘聊天,而是一条人机研究生产线

这次公布的成果横跨高维几何、编码理论、群论、算术电路复杂性、量子复杂性、格密码和极值组合数学等方向。

更重要的是,它们并不是模型在聊天框里吐出十段文字后,OpenAI就宣布胜利。

官方披露的流程至少包含三个阶段。

第一阶段,Astra寻找候选解法和核心数学论证。

第二阶段,人类研究人员与同一模型合作,把论证整理成可以阅读的数学手稿。

第三阶段,模型将证明形式化为Lean证书。

OpenAI同时公开了一份249页的论文,以及与十项成果对应的Lean形式化仓库。

所以,这不是一次“AI灵光一闪”。

它更像一条新型研究流水线:

模型负责大规模搜索和生成候选论证。

人类负责整理、对应原问题和解释数学意义。

形式化工具负责检查逻辑链条。

专家负责判断创新性和研究价值。

AI并没有独立运营一家研究所。

但它已经开始占据研究生产线中最核心、也最昂贵的环节之一:

产生此前不存在的候选成果。

Lean很严格,但它不是“数学界自动盖章机”

这里必须解释一下Lean。

Lean是一种交互式定理证明工具。

研究人员把数学定义、命题和证明步骤翻译成形式语言后,Lean的内核可以检查一个证明是否能够从既定定义、公理和前置结论中严格推出。

你可以把它想象成一台极其严格的数学验算机。

普通数学论文中,一句话可能写成:

“显然可得。”

Lean不会轻易接受“显然”。

每一步如何推出,依赖了什么定义,使用了什么定理,都要能够被系统检查。

OpenAI公开的仓库元数据显示,形式化项目的 sorry_count为0,也就是没有使用代表未完成证明的占位符;项目记录的形式化流程实际耗时约一周,审查状态则标记为agent-reviewed

这是一个很强的形式验证信号。

但它仍然不等于“数学界已经完成验收”。

因为Lean能回答的问题是:

“按照这些形式定义和前提,这个结论能否严格推出?”

它无法单独回答:

“形式化的命题,是否准确对应数学家原本提出的问题?”

“这个成果是否真的首次出现?”

“是否遗漏了前人的相关工作?”

“这个结果对所在领域究竟有多重要?”

Lean官方文档也明确区分了两件事:

一个命题是否拥有有效证明,与这个形式命题在人类语境中究竟意味着什么,并不是同一个问题。

这就像一份合同。

电脑可以检查合同内部是否自洽。

但它不能仅凭形式逻辑判断,这份合同是否准确表达了双方原本想达成的交易。

AI数学成果至少要过三道门

我把AI生成的数学研究成果,大致分成三道验收关。

第一道,是形式正确性。

证明的每一步是否成立?

有没有逻辑跳跃?

有没有隐藏使用不允许的假设?

Lean在这一关非常有价值。

第二道,是语义对应性。

形式化后的命题,是否真的是原来的开放问题?

有没有在转换定义的过程中悄悄缩小范围?

有没有证明一个看起来很像、实际却不同的命题?

这一关需要形式化专家和领域数学家共同完成。

第三道,是创新性与重要性。

结果是否已被别人提前证明?

引用是否完整?

它解决的是核心问题,还是技术性分支?

能否带来新的方法和后续研究?

这一关,依然需要数学共同体的同行评议。

截至2026年8月6日,OpenAI仓库公开标注的仍是“代理审查”,而不是“已完成外部同行评审”。

这不代表成果存在错误。

它只意味着:

机器验算通过,不能被提前翻译成整个数学界已经完成验收。

AI越会生产结果,人类的验收账单可能越贵

看到这里,我反而觉得数学家不会突然没活干。

他们可能会变得更忙。

因为当模型能够低成本生成大量候选证明后,人类专家需要完成的工作会迅速增加。

核对问题。

阅读证明。

还原关键思想。

排查隐含假设。

搜索既有文献。

判断创新程度。

评估成果是否能够推广。

最后,还要有人公开署名、背书并承担责任。

过去,数学研究最稀缺的是能够写出证明的人。

未来,更稀缺的可能是愿意把几百页证明读完,并且真正有能力判断它意味着什么的人。

这就是我从Astra事件中看到的关键趋势:

知识生产的瓶颈,正在从“生成候选答案”,转向“验证答案、理解答案和使用答案”。

这和互联网时代很像。

当内容生产变得便宜后,稀缺的不再是内容。

而是注意力、判断力和可信度。

当AI研究成果也开始批量出现后,稀缺的将不只是研究能力。

而是高质量同行评议、形式化基础设施、领域共识和责任机制。

这件事和普通人的工作有什么关系

很多人看到数学新闻,会觉得离自己的工作很远。

其实并不远。

因为几乎每一份工作,都同时包含两类任务。

第一类任务,有答案本。

代码能不能通过测试。

数据加总是否正确。

合同有没有漏掉必要条款。

流程是否缺少审批环节。

表格公式是否写错。

这类任务的特点,是结果容易被验证。

第二类任务,没有答案本。

这个产品到底要不要做。

这个人值不值得招聘。

这条业务路线是否应该继续投入。

某项风险是否值得承担。

一份方案究竟能不能在现实环境中运行。

这类任务的特点,是你不仅要给出答案,还要定义什么叫“好答案”。

以前我们习惯认为,AI只能完成第一类任务。

Astra所代表的变化是,AI正在开始进入第二类任务:

它可以在没有现成答案的情况下,生成一套新的候选方案。

但请注意,是“候选方案”。

能生成,不等于能采用。

能论证,不等于能落地。

能通过内部测试,不等于能对现实后果负责。

数学之所以会走在前面,是因为数学拥有Lean这样的形式化验证工具。

而企业战略、医疗决策、法律意见、组织管理和产品方向,往往没有一台可以直接按下按钮的“正确性检查器”。

可验证性越强的行业,越容易率先引入高自主性的AI。

可验证性越弱、现实责任越大的行业,人类验收者就越重要。

当答案变得便宜,真正昂贵的是问题和责任

所以,看完整件事后,我最大的感受并不是:

“AI只花2000美元,就把数学家打败了。”

我看到的是另一幅画面。

模型正在让候选答案的生产成本快速下降。

过去需要少数专家长期搜索的思路,现在可能被模型并行探索。

过去因为时间不够而被放弃的路线,AI可以继续尝试。

过去无法规模化的研究探索,开始呈现出工业化生产的雏形。

但当答案越来越多,新的难题也随之出现。

哪些问题值得解决?

哪些结果值得相信?

哪些证明真正有新意?

哪些结论能够进入现实世界?

出了问题,谁承担责任?

Astra最重要的意义,不是它给数学家交了十份答案。

而是它把一张更大的试卷,递到了所有人面前。

以前,我们竞争的是谁更会回答问题。

接下来,我们竞争的可能是:

谁能提出真正重要的问题。

谁能设计可靠的验收标准。

谁能从海量候选结果中识别价值。

以及谁愿意为最终决策负责。

当“给出一个看起来不错的答案”变得异常便宜以后,真正昂贵的,从来不是答案。

而是问题。

是判断。

也是责任。

关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部