Skip to content
FunCoding

Search

Search docs, Skills and MCP

News · Still developing

OpenAI 数学成果引验证争议

11 sources14 reportsOct 7, 2026 – Oct 9, 2026

Latest陶哲轩批评 OpenAI 发布 719 篇 AI 数学证明:人类来不及理解和消化

Summary

OpenAI 公布一项数学成果:一个未发布的前沿模型产出 722 份稿件、涉及 372 个族,覆盖数论、复杂性理论和数学物理。曾研究 Barnette 猜想 24 年的 Jake Boggan 称该猜想(问题 180)据称已被这项工作解决,他为此投入数千小时,得知后感到一种遥远的悲伤。

质疑随之而来。Gary Marcus 认为真正的新闻不是结果本身,而是报告完全没有说明验证流程、模型架构、失败率和训练细节,无法判断其通用性,也可能只是适用于可验证领域的 Lean 与合成数据技巧。Ethan Mollick 转述 Scott Aaronson 博客中数学家 Dana Moshkovitz 的第一手体验:UGC 相关证明写作混乱、几乎无法在没有 AI 帮助的情况下读懂,部分 372 项突破性结果附有 Lean 证书,但尚无人类理解其中多数证明。

人类数学协会(AHM)批评这批手稿,敦促数学家停止与 OpenAI 合作,称 OpenAI 忽略了其顾问小组关于前沿 AI 公司不应在内部模型上测试高深数学问题的立场;Terence Tao 在博客转发了该声明,并在 Caltech 演讲中称 AI 解数学猜想可以走得更慢一些。普林斯顿高等研究院 AGMAI 顾问组指出,这批解答未完全遵循 9 月底发布的规范。此后 OpenAI 撤回了它两天前发布的一篇数学论文的部分内容。

Coverage timeline (14)

  1. IT之家·人工智能

    陶哲轩批评 OpenAI 发布 719 篇 AI 数学证明:人类来不及理解和消化

    陶哲轩于 10 月 7 日在 mathstodon 发帖,批评 OpenAI 10 月公布 719 份 AI 数学解答(涵盖 372 个结果族)的做法,称这会把开放问题变成可批量消耗的资源。他不反对 AI 辅助研究,但反对把快速攻克著名难题当产品展示,指出约 42% 证明未经形式化处理、仅 10 份附推理链,未达到 AGMAI 建议的披露标准,并担心出现大量无人能消化的证明。

  2. X:Rohan Paul (@rohanpaul_ai)

    OpenAI 撤回两天前发布的数学论文

    OpenAI 撤回了它两天前发布的一篇数学论文的部分内容。

  3. Platformer(热点 RSS)

    OpenAI 数学突破速度超过人类理解:数学家面临身份危机

    OpenAI 在数学问题上的突破速度已超过人类理解解题过程的速度,可能引发数学家的身份危机。Platformer 报道指出,这一进展让人追问下一个受冲击的领域会是什么。

  4. The Decoder:AI News(RSS)

    部分数学家呼吁抵制 OpenAI,AI 生成的数学证明涌入数学领域

    AHM 组织在 Terence Tao 主持下发表声明,呼吁抵制 OpenAI,称其一次性发布 700 多个 AI 生成证明文件是展示力量而非学术行为。此前 OpenAI 宣称内部模型一个月内解决逾 100 个开放数学问题,约 8000 个测试问题成功率约 5%,平均每个耗时 3 小时 GPT-Pro 级算力。

  5. TechCrunch:AI(RSS)

    OpenAI 发布的数学证明尚未达到数学界制定的规范标准

    OpenAI 本周发布数百份针对世界最难数学问题的 AI 解答,但普林斯顿高等研究院 AGMAI 顾问组指出其未完全遵循 9 月底发布的规范。

  6. X:Rohan Paul (@rohanpaul_ai)

    Terence Tao 谈 AI 解数学猜想:我们可以走得更慢一些

    作者转述 Terence Tao 在 Caltech Science x AI Summit 主题演讲中的观点,认为 AI 虽在快速解决重大猜想,但做法缺乏从容和原则,Navier-Stokes 这类问题无需急于求成。同帖还提及数学界组织 AHM 批评 OpenAI 发布 722 份数学手稿,呼吁数学家停止与 OpenAI 合作,Tao 曾在其博客转发该声明。

  7. X:Rohan Paul (@rohanpaul_ai)

    AHM 批评 OpenAI 发布 722 份数学手稿,Terence Tao 转发声明,作者称抵制不是科学立场

    人类数学协会(AHM)批评 OpenAI 前一日发布的 722 份数学手稿仓库,敦促数学家停止与 OpenAI 合作,并指出 OpenAI 忽略了其顾问小组关于前沿 AI 公司不应在内部模型上测试高深数学问题的立场。Terence Tao 在博客转发了 AHM 声明。作者 Rohan Paul 认为,数学界在保护自己的地盘,而脱离合作不是科学的态度。

  8. X:Ethan Mollick (@emollick)

    Ethan Mollick 转述数学家面对 OpenAI 数百个 AI 证明的第一手体验

    Ethan Mollick 转发 Scott Aaronson 博客内容,汇集数学家阅读 OpenAI 发布的数百个大型 AI 证明的第一手体验,称其为遭遇狭窄超人类智能的早期记录。其中 Dana Moshkovitz 描述 UGC 相关证明写作混乱、几乎无法在没有 AI 帮助的情况下读懂,部分 372 项突破性结果附有 Lean 证书,但尚无人类理解其中多数证明。

  9. Gary Marcus:The Road to AI We Can Trust(RSS)

    Gary Marcus 与 Terence Tao 评 OpenAI 数学模型发布:报告缺乏可审查细节

    Gary Marcus 评 OpenAI 新数学成果,认为真正的新闻不是结果本身,而是报告完全没有说明验证流程、模型架构、失败率和训练细节,无法判断其通用性,也可能是仅适用于可验证领域的 Lean 与合成数据技巧。他还批评社交媒体的讨论沦为不加追问的喝彩,并附上 Terence Tao 转发的恶搞新闻稿作为第二部分。

  10. Azeem Azhar:Exponential View(RSS)

    Azeem Azham 评 OpenAI 未发布模型的数学成果:人类还剩什么可做

    Azeem Azhar 评述 OpenAI 前一日公布的一项数学成果:一个未发布的前沿模型产出 722 份稿件、涉及 372 个族,覆盖数论、复杂性理论和数学物理,平均每项成果相当于 ChatGPT Pro 三小时的思考。

  11. X:马东锡 NLP (@dongxi_nlp)

    OpenAI 的 verifier scaling 为何体验最差

    LLMs 有很多可以 scale 的维度。 但 OpenAI 最近的拉垮告诉我们,verifier scaling 目前看来是最无聊,最慢,用户体验感最差的一种 scale 方式。

  12. Simon Willison 博客

    Jake Boggan 谈 OpenAI 数学成果解决 Barnette 猜想

    曾研究 Barnette 猜想长达 24 年的 Jake Boggan 在 Hacker News 评论称,该猜想据称已被 OpenAI 的数学工作解决(问题 180)。他为此投入了数千小时,得知被解决后感到一种遥远的悲伤。

  13. X:马东锡 NLP (@dongxi_nlp)

    OpenAI 发布 math 项目,数学验证引热议

    OpenAI 发布 Openai/math,作者认为这似乎表明数学问题或一切可被 verify 的问题已被解决。作者同时吐槽 OpenAI 耗尽了其 Pro 的所有 token,偏离主线任务,开启无数 subagent 做无意义测试,最终感叹一切都是"为了 verify 而 verify"。

  14. The Verge:AI(RSS)

    AI 接管数学界引发争议:OpenAI、Anthropic 的数学突破与学界反弹

    过去一年 OpenAI、Anthropic 等实验室宣布解决多个长期数学难题,包括一个千禧年大奖难题,进展超出研究者对现有系统的预期。但这些突破在学界引发反弹,数学家要求 OpenAI 证明未使用其成果,AI 实验室称正从早期错误中学习。

Related stories

Data from AIHOT. Summaries are AI-generated; check the original for details.