热点 · 持续报道中
OpenAI 数学成果引验证争议
11 个来源14 篇报道2026年10月7日 – 2026年10月9日
最新进展陶哲轩批评 OpenAI 发布 719 篇 AI 数学证明:人类来不及理解和消化
事件综述
OpenAI 公布一项数学成果:一个未发布的前沿模型产出 722 份稿件、涉及 372 个族,覆盖数论、复杂性理论和数学物理。曾研究 Barnette 猜想 24 年的 Jake Boggan 称该猜想(问题 180)据称已被这项工作解决,他为此投入数千小时,得知后感到一种遥远的悲伤。
质疑随之而来。Gary Marcus 认为真正的新闻不是结果本身,而是报告完全没有说明验证流程、模型架构、失败率和训练细节,无法判断其通用性,也可能只是适用于可验证领域的 Lean 与合成数据技巧。Ethan Mollick 转述 Scott Aaronson 博客中数学家 Dana Moshkovitz 的第一手体验:UGC 相关证明写作混乱、几乎无法在没有 AI 帮助的情况下读懂,部分 372 项突破性结果附有 Lean 证书,但尚无人类理解其中多数证明。
人类数学协会(AHM)批评这批手稿,敦促数学家停止与 OpenAI 合作,称 OpenAI 忽略了其顾问小组关于前沿 AI 公司不应在内部模型上测试高深数学问题的立场;Terence Tao 在博客转发了该声明,并在 Caltech 演讲中称 AI 解数学猜想可以走得更慢一些。普林斯顿高等研究院 AGMAI 顾问组指出,这批解答未完全遵循 9 月底发布的规范。此后 OpenAI 撤回了它两天前发布的一篇数学论文的部分内容。
综述由 AIHOT 用 AI 根据各家报道生成,细节以原文为准。
报道时间线(14)
IT之家·人工智能
陶哲轩批评 OpenAI 发布 719 篇 AI 数学证明:人类来不及理解和消化陶哲轩于 10 月 7 日在 mathstodon 发帖,批评 OpenAI 10 月公布 719 份 AI 数学解答(涵盖 372 个结果族)的做法,称这会把开放问题变成可批量消耗的资源。他不反对 AI 辅助研究,但反对把快速攻克著名难题当产品展示,指出约 42% 证明未经形式化处理、仅 10 份附推理链,未达到 AGMAI 建议的披露标准,并担心出现大量无人能消化的证明。
X:Rohan Paul (@rohanpaul_ai)
OpenAI 撤回两天前发布的数学论文OpenAI 撤回了它两天前发布的一篇数学论文的部分内容。
Platformer(热点 RSS)
OpenAI 数学突破速度超过人类理解:数学家面临身份危机OpenAI 在数学问题上的突破速度已超过人类理解解题过程的速度,可能引发数学家的身份危机。Platformer 报道指出,这一进展让人追问下一个受冲击的领域会是什么。
The Decoder:AI News(RSS)
部分数学家呼吁抵制 OpenAI,AI 生成的数学证明涌入数学领域AHM 组织在 Terence Tao 主持下发表声明,呼吁抵制 OpenAI,称其一次性发布 700 多个 AI 生成证明文件是展示力量而非学术行为。此前 OpenAI 宣称内部模型一个月内解决逾 100 个开放数学问题,约 8000 个测试问题成功率约 5%,平均每个耗时 3 小时 GPT-Pro 级算力。
TechCrunch:AI(RSS)
OpenAI 发布的数学证明尚未达到数学界制定的规范标准OpenAI 本周发布数百份针对世界最难数学问题的 AI 解答,但普林斯顿高等研究院 AGMAI 顾问组指出其未完全遵循 9 月底发布的规范。
X:Rohan Paul (@rohanpaul_ai)
Terence Tao 谈 AI 解数学猜想:我们可以走得更慢一些作者转述 Terence Tao 在 Caltech Science x AI Summit 主题演讲中的观点,认为 AI 虽在快速解决重大猜想,但做法缺乏从容和原则,Navier-Stokes 这类问题无需急于求成。同帖还提及数学界组织 AHM 批评 OpenAI 发布 722 份数学手稿,呼吁数学家停止与 OpenAI 合作,Tao 曾在其博客转发该声明。
X:Rohan Paul (@rohanpaul_ai)
AHM 批评 OpenAI 发布 722 份数学手稿,Terence Tao 转发声明,作者称抵制不是科学立场人类数学协会(AHM)批评 OpenAI 前一日发布的 722 份数学手稿仓库,敦促数学家停止与 OpenAI 合作,并指出 OpenAI 忽略了其顾问小组关于前沿 AI 公司不应在内部模型上测试高深数学问题的立场。Terence Tao 在博客转发了 AHM 声明。作者 Rohan Paul 认为,数学界在保护自己的地盘,而脱离合作不是科学的态度。
X:Ethan Mollick (@emollick)
Ethan Mollick 转述数学家面对 OpenAI 数百个 AI 证明的第一手体验Ethan Mollick 转发 Scott Aaronson 博客内容,汇集数学家阅读 OpenAI 发布的数百个大型 AI 证明的第一手体验,称其为遭遇狭窄超人类智能的早期记录。其中 Dana Moshkovitz 描述 UGC 相关证明写作混乱、几乎无法在没有 AI 帮助的情况下读懂,部分 372 项突破性结果附有 Lean 证书,但尚无人类理解其中多数证明。
Gary Marcus:The Road to AI We Can Trust(RSS)
Gary Marcus 与 Terence Tao 评 OpenAI 数学模型发布:报告缺乏可审查细节Gary Marcus 评 OpenAI 新数学成果,认为真正的新闻不是结果本身,而是报告完全没有说明验证流程、模型架构、失败率和训练细节,无法判断其通用性,也可能是仅适用于可验证领域的 Lean 与合成数据技巧。他还批评社交媒体的讨论沦为不加追问的喝彩,并附上 Terence Tao 转发的恶搞新闻稿作为第二部分。
Azeem Azhar:Exponential View(RSS)
Azeem Azham 评 OpenAI 未发布模型的数学成果:人类还剩什么可做Azeem Azhar 评述 OpenAI 前一日公布的一项数学成果:一个未发布的前沿模型产出 722 份稿件、涉及 372 个族,覆盖数论、复杂性理论和数学物理,平均每项成果相当于 ChatGPT Pro 三小时的思考。
X:马东锡 NLP (@dongxi_nlp)
OpenAI 的 verifier scaling 为何体验最差LLMs 有很多可以 scale 的维度。 但 OpenAI 最近的拉垮告诉我们,verifier scaling 目前看来是最无聊,最慢,用户体验感最差的一种 scale 方式。
Simon Willison 博客
Jake Boggan 谈 OpenAI 数学成果解决 Barnette 猜想曾研究 Barnette 猜想长达 24 年的 Jake Boggan 在 Hacker News 评论称,该猜想据称已被 OpenAI 的数学工作解决(问题 180)。他为此投入了数千小时,得知被解决后感到一种遥远的悲伤。
X:马东锡 NLP (@dongxi_nlp)
OpenAI 发布 math 项目,数学验证引热议OpenAI 发布 Openai/math,作者认为这似乎表明数学问题或一切可被 verify 的问题已被解决。作者同时吐槽 OpenAI 耗尽了其 Pro 的所有 token,偏离主线任务,开启无数 subagent 做无意义测试,最终感叹一切都是"为了 verify 而 verify"。
The Verge:AI(RSS)
AI 接管数学界引发争议:OpenAI、Anthropic 的数学突破与学界反弹过去一年 OpenAI、Anthropic 等实验室宣布解决多个长期数学难题,包括一个千禧年大奖难题,进展超出研究者对现有系统的预期。但这些突破在学界引发反弹,数学家要求 OpenAI 证明未使用其成果,AI 实验室称正从早期错误中学习。
相关事件
数据来自 AIHOT,标题和摘要由 AI 根据原文生成,细节以原文为准。