站点图标 AI Siri-苹果智能资讯网

GPT-6一日破解五道数学难题,创OpenAI史上最强纪录

GPT-6一日破解五道数学难题,创OpenAI史上最强纪录

最近,OpenAI 扔出了一颗真正意义上的核弹——他们正式发布了品牌历史上最强的模型:GPT-6 Astra。官方口径很直接:这是目前全球智能水平最高、对齐效果最好的生成式 AI 模型。

但这颗核弹不是在哪个数据中心随便搓出来的。它的训练在得克萨斯州 Stargate 超算基地完成,动用了超过 10 万张 GPU 做预训练。有趣的是,这是 OpenAI 首次大规模使用前代模型参与监督训练——这意味着,GPT-5.6 某种程度上成了 GPT-6 Astra 的助教。

真正让业界炸锅的,是它随后在一项数学基准测试里的表现。

Epoch AI 与曼彻斯特大学联手发布了一个名为 FrontierMath Erdős(简称 FME)的测试。这里面的 68 道题,全是人类数学界长期悬而未决的难点,没有标准答案,不可能通过“背数据集”蒙混过关;AI 必须输出 Lean 语言的形式化证明,由内核自动验算对错。所有参赛模型统一预算 300 美元,限时 72 小时。

结果有点惨烈:GPT-5.6、Claude Fable 5.1 等四款主流 AI 得了个大鸭蛋。唯独 GPT-6 Astra,不仅答出了题,还一口气攻破了 5 道长期无人解开的猜想。

这几道题随便拿出来一道都挺有来头。比如 Erdős 18 岁提出的“解离集猜想”,老爷子自称那是他“人生第一个正经问题”;还有极值图论里赫赫有名的 Erdős-Sós 猜想。这些题目困住了无数顶尖数学家几十年,最后被一段代码推导出了反例或完整证明。

当然,代价也不低。GPT-6 在这 5 道题的尝试里,总共烧掉了超过 22 万美元的算力。如果把标准测试里那个 2 万美元的花销也算上,按照 300 美元一次、3% 成功率估算,解出一道重要开放问题的期望成本大约是 1 万美元。这个数字放在科研经费里谈,已经开始显得“划算”了。

不过,咱们也别急着喊“AGI 时代已到”。论文里坦承了一个关键缺陷:模型有时能找出正确思路,却无法转换成 Lean 形式的可验证证明。而且基准只测了解题,数学研究里同等重要的“提出好问题”这一环,GPT-6 暂时还没展现出什么想象力。68 道难题还有 63 道纹丝不动。

OpenAI 很强,至少在“做题”这件事上,它已经拉开了肉眼可见的代差。但要说靠一个会算数的模型就能接管数学皇冠,恐怕还差着几道没解出来的猜想。

GPT-6 Astra 在数学难题测试中的表现

退出移动版