新智元消息
最新10道数学题,24小时大翻盘。
OpenAI与Anthropic这两大AI劲旅,在数学高地的最前沿火拼。
先是8月1日,OpenAI的Sébastien Bubeck研究员透露,他们未公开的新一代模型Astra,一口气解决了10个棘手的数学难题,还提供了10份Lean证明、10份逐题解析。
别看这只是10个问题。
它们的主要结论至少十年无人问津,不少问题沉寂了数十年,确实是真金白银的未解之谜。
虽算不上数学界最深的未解之谜,但每一个都极其难解。
Epoch AI旗下的FrontierMath负责人Elliot Glazer评论指出:仅非索菲克群这一项,就足以让数学界顶级期刊Annals of Mathematics repost。
这10个难题一出,AI圈炸开了锅,有人当场呼喊「数学奇点已然来临」。
Anthropic迅速反击。
不到24小时,研究员Levent Alpöge就在Bubeck的帖子里写道:「我用Fable完成了一半。」
他接着补充,自己搞定的是OpenAI清单里的第4、5、6、7、8题,共计5项。
实验条件,Levent说很纯粹:完全自主运行、通用提示词、全程断网,为防止OpenAI的解法被泄露,还特别设置了防泄漏层。
当然,Levent目前没放出Fable的完整证明材料,他表示之后会上传。
假如验证结果属实,情况就不同了:
OpenAI靠未发布模型Astra抢到的首发优势,只维持了24小时。而赶超的Fable,是Anthropic早就公开、所有人都能调用的模型。
「数学首发」的时效性减半
网友Chubby转发说:「公开可用的Fable,已经复现了Astra一半成果。」
评论区有笑话:这么看,OpenAI是不是只抢了个寂寞?
以前,数学成果的优先权之争,通常以年为单位。
谁先想到、谁先证出、谁先发表,中间隔着漫长的投稿、审稿、修改过程。
现在,Astra还没正式发布,它公布的成果,仅24小时,就被一个公开模型追平了一半。
首发的价值还在,但时效性大大缩短。
有人已经喊出「数学奇点」,两大AI巨头也展开了激烈竞争。
不到2000美元的投入
背后还有更高成本
OpenAI还曝出个数据:找到这10个解法,花费不到2000美元。
研究员Noam Brown解释,这是基于寻找这些解法所需的token数量,按Sol API价格折算的。
也就是说,这只是成功跑出10个解法的边际推理成本。
除此之外,还有Astra本身的研发费用、那些尝试失败的问题、人类将论证整理成249页论文的时间、将每个证明形式化成Lean的成本,以及最后外聘数学家审查的费用。
Noam本人也承认,他们还试过其他重大问题,但都失败了,千禧年大奖难题一个都没解决。
即便如此,2000美元仍然将AI解出一道前沿难题的边际成本,压到了极低水平。
有人甚至打趣,OpenAI是不是明天又会公布10项数学新突破,或者下周一次发100道题。
从「互相较量」到「相互检验」
Fable去核实Astra的同一批题,这件事比单纯刷榜更有意思。
刷榜比较的是已知答案:题目和答案都在那里,比谁更快。
而这两个模型在无网络、防泄漏的情况下,各自独立得到同一个前沿结论,比的是完全不同的东西:这个结果是否可靠,能不能被独立验证。
这更像是同行评审。
Levent现在只是在X上「表明了结果」,还没提供那5项证明的PDF、提示词、完整运行日志、token耗用或Lean证书。
网友Haider质疑:就算是真的,为何要用Fable去重做









