产品派
返回

GPT-6 Astra攻克FrontierMath Tier 4最后难题

AI量子位2026/9/12 15:33:54
AI 导读

GPT-6 Astra近日解出了FrontierMath Tier 4此前唯一尚未被人工智能成功完成的题目。由此,按照Epoch AI的累计统计方式,Tier 4的43道题都至少有过一次AI正确解答,正式进入“饱和”状态。Astra单次公开成绩为97.6%,并非每道题都在同一轮测试中答对,但它补上了此前的最后缺口。

这里的“全部解出”并不等于某个模型一次性拿到满分,而是将不同模型、不同时间的测试结果合并计算。即使Astra在某些题目上出现失误,只要它成功解决了此前从未被AI攻破的那一道,就足以改变Tier 4的累计覆盖情况。

FrontierMath Tier 4在2025年7月11日推出时,最高正确率只有约5%;如今仅过了一年多,这道曾被视为研究级高墙的防线便被跨越。马凯特大学数学副教授Jay Pantone表示,过去模型常通过数值捷径作答,而这次Astra给出的思路与他本人处理该问题的方式相当接近。近期Astra还频繁解决数学领域的高难问题,Pantone称自己已经不太容易感到意外。

FrontierMath于2024年11月7日发布,目标是避免传统GSM8K、MATH等基准被头部模型迅速刷穿。Epoch AI联合60多位数学家设计了300道原创题,参与者包括陶哲轩、Timothy Gowers和Richard Borcherds等菲尔兹奖得主。题目分为三个层级,首轮测试中领先模型整体正确率不足2%,陶哲轩还曾认为最难的Tier 3可能让AI停滞数年。

Tier 1大致对应高难度本科题和数学竞赛题,但允许使用更高级工具;Tier 2接近高年级研究生难度;Tier 3则涉及博士早期的探索性研究。随着推理模型能力提升,Epoch AI在2025年新增Tier 4,进一步提高挑战强度。

Tier 4题目主要由数学教授和博士后设计。出题者围绕各自研究方向进行数周短期研究,再将成果压缩成可自动验证的问题,覆盖分析、数论、组合数学、拓扑和代数几何等领域。最初该层级有50题,所有模型累计仅解出3题,且部分答案依赖正确但论证不充分的假设,官网一度称部分题目可能数十年内都不会被AI解决。

随着模型能力提升,题库质量问题也逐渐暴露。OpenAI测试发现其中存在较多错误,Epoch AI随后先用GPT-5.5和Claude Opus 4.7筛查,再由数学家逐题审计。2026年6月发布的v2版本修正了12题、移除7题,Tier 4最终保留43题。

修订后的成绩继续上升:GPT-5.6 Sol达到83.0%,Claude Fable 5达到90.2%,GPT-6 Astra达到97.6%。更重要的是,Astra解决了此前唯一未被AI攻克的题目。

这并不意味着数学问题已经被人工智能解决。项目目前已扩展到Tiers 1至4之外的Open Problems,以及将Erdős开放问题形式化到Lean中的FrontierMath Erdős。前者直接测试尚未解决的数学研究问题,后者要求生成可通过形式化验证的完整证明;在68道Erdős题目中,Astra目前只解决了2道,后续挑战仍在继续。

GPT-6 AstraFrontierMathAI数学数学基准测试

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文