就在外界还在消化"前沿模型触及千禧年大奖难题"的宣称之际,OpenAI 于10月7日投下第二枚炸弹:一次性公开722篇由 AI 生成的数学研究论文,宣称在数百道长期悬而未决的公开数学难题上取得实质性进展。华盛顿邮报称这批成果"令人类数学家震惊",《科学美国人》则形容:一个本已处于震动中的领域,又被补上了数百记重击。
发生了什么:一周内的第二波冲击
此前 OpenAI 宣称其前沿模型在千禧年大奖难题之一上取得突破,曾在数学界引发激烈争论。数日之后,公司把成果规模放大了两个数量级:722篇论文一次性放出,证明材料同步上传 GitHub。各媒体口径略有出入:华盛顿邮报称"300余道",Fortune 等给出"370余至377道";另有报道称其模型已解出"500道最难公开难题"中的约90道,该数字尚待独立核实。
多源事实速览(截至2026-10-08)
· 论文规模:722篇 AI 生成数学论文一次性发布(Quartz)
· 难题进展:300余道—377道未解难题获得新进展(华盛顿邮报 / Fortune / Ynetnews)
· 开放验证:372份证明材料上传 GitHub(The Decoder)
· 争议焦点:绕过同行评审的"倾倒式"发表(ForkLog 等多源)
陶哲轩团队上手核验:真正的瓶颈是验证速度
此次数学界的反应呈现两极:以陶哲轩(Terence Tao)为代表的团队已开始系统性核验这批主张;Gary Marcus 等批评者则直指其发表方式——未经同行评审、直接向公共平台倾倒数百篇机器生成证明,等于把验证成本转嫁给了整个数学共同体。
机器生成证明的速度,第一次在数量级上超过了人类检查证明的速度——这不是学术礼仪问题,而是科研范式层面的结构性冲击。
对行业的三点启示
- 评审体系承压:arXiv 已因 AI 论文洪峰被迫限流,此次事件将进一步加剧预印本生态的守门人危机;
- 可验证性成为底线:无论模型多强,"产出可被独立核验"才是科研与企业场景的共同门槛;
- 长推理链审计需求抬头:对 AI 长链条输出的抽样审计、置信标注与溯源,正从可选项变为必选项。
同样的逻辑正在业务侧复制:当智能体批量产出决策与代码,审计与治理必须同步到位。九天技术的天盾平台在智能体安全审计上的实践、天行对多智能体任务的调度治理,正是面向这类"高产出、强验证"场景的设计。
(信息综合自 华盛顿邮报、Fortune、Quartz、科学美国人、The Decoder 等公开报道)