OpenAI 一夜放出 722 份数学手稿:AI 时代最贵的不是产出,是验证
发布时间:2026/10/8 13:30:51 作者:尧图编辑部 阅读量:1,286

专注 AI 工程化实践与出海外贸技术一、发生了什么10 月 6 日OpenAI 在 GitHub 公开722 份数学手稿归为 372 组成果来自一款未发布的内部前沿模型官方称每题平均消耗约 3 小时 ChatGPT Pro 等效推理算力来源OpenAI 官方发布、WIRED。前一天维基媒体基金会披露平台发现据信由 OpenAI Agent 产生的数百万次自动化 API 请求以及未走社区审批的编辑与代理滥用尝试来源Wikimedia 官方披露Ars Technica 跟进。两件事指向同一个结构性问题。二、技术拆解先看数学线。722 不是 722 道独立难题372 组「家族」里一组可含主结果、衍生论证、推论和不同证明。课题含金量确实高——准黎曼猜想宣称黎曼 ζ 函数在实部大于 7/8 的区域无零点、唯一博弈猜想、霍奇猜想特殊情形等来源虎嗅/APPSO。但关键信息在 README 那句大实话部分未形式化的结果可能存在问题。只有 162 份主结论附有 Lean 形式化材料——Lean 是能被计算机逐条核验的证明语言且形式化范围有限。这分出了三层完全不同的「验证强度」验证方式机器可判定能回答的问题缺点博客 / 推特发布❌无法回答零门槛错误直接进公共视野GitHub 手稿 引用协议❌谁写的、怎么改可查但仍需人读无法证伪Lean 形式化✅证明是否成立只核验主结论覆盖率有限传统同行评审❌成立 为什么 边界慢但慢出的理解不可替代Lean 能回答「这个证明对不对」回答不了「为什么这样想、能否推广、归属算谁的」——只能靠数学家逐篇消化。OpenAI 承诺资助 workshops 并改进引用来源OpenAI 官方回应。再看维基线。Wikimedia 的结论很克制无证据表明系统或数据被入侵也未发现 Agent 借其平台协调。但代价清单很长——数百万 API 请求、数百万页面爬取集中在 Wikidata 与 Commons、数十万次 Wikidata 查询后者可能贡献了今年 5 月该服务的一次部分宕机基金会还报告过 2024 年以来带宽消耗增长 50%、最重负载流量 65% 来自爬虫来源Wikimedia 官方披露归因调查本身也消耗志愿者大量时间。上月《本周 AI 观察950 个 Agent 发现新酶…》写过澳方 Medicare 门户事件结论是「瓶颈转向爆炸半径」维基这次把账算得更细没被攻破 ≠ 没有成本验证和清理的成本被外部化给了公共基础设施。两条线合起来模型产出成本一年内塌掉几个数量级而消化产出的机制——同行评审、社区审批、归因调查——成本一分没降。三、我的判断第一瓶颈换了位置。过去稀缺「算出结果」现在稀缺「验住结果」。AGMAI数学与人工智能顾问组9 月 29 日的建议书点破要害用闭源模型产出成果、他人无法接触工具会形成两级研究社区——AI 公司生产发现其他人只能等施舍来源AGMAI via IAS。这次回应也刻意声明「参与不是背书」。第二验证会分层定价。数学界的答案是「自动检查 人类理解」双轨Lean 管对错论文管理解。工程团队同理——自动检查管不了的恰恰是理解、归属与边界。罗格斯大学的 Kontorovich 说准黎曼成果若由人类完成可竞争菲尔兹奖来源虎嗅/APPSO 转述但「值得给奖」和「值得直接引用」之间隔着整个消化流程。第三别急着娱乐化「3 小时解一道难题」。3 小时是计算等效口径不是验证耗时——722 份手稿多久才能确认到「可安全引用」OpenAI 没给时间表。产出与消化的剪刀差只会越拉越大。四、对开发者的启示当 AI 能一夜生成 722 份代码变更团队的 review 容量就是新瓶颈。三个动作给 AI 产出设验收闸门不按产量排期——产出越多验收预算占比应越高这与直觉相反分层验证类型检查、单测、静态扫描是「Lean 层」管对错不管好坏架构评审是「论文层」管理解与归属两层都别省机器流量留身份Wikimedia 的核心诉求是「Agent 流量应可识别、可选择」你自己的爬虫与 Agent 调用也按会被人审计的标准来。完整模板放文末可以直接拿走。FAQQ722 份手稿等于解决了 722 个难题吗不等于。722 份归为 372 组家族一组可含主结果、推论和替代证明多数未经独立验证只有 162 份主结论附 Lean 形式化。QLean 形式化是不是万无一失不是。它核验的是「形式化后的命题是否成立」形式化本身可能引入偏差且覆盖率有限——未形式化部分 OpenAI 自己承认可能有问题。QWikimedia 事件说明 Agent 不安全吗更准确是「不可控成本」系统没被入侵、数据没泄露但请求与归因成本由被访问方承担。限流、可识别的 Agent 身份、代理类工具的配置审计比事后追责更实际。上周的延伸Agent 撞上公共基础设施不是第一次《本周 AI 观察》梳理过爆炸半径案例链《Agent 关进内核里》讨论了运行时侧防线。昨天的《GPT-6 Astra 作弊案》与本篇同题该背锅的不是模型是验收机制更早的《分层》解释了验证预算为何按任务形态分档。这个专栏每天一篇 AI 解读关注不迷路。你们团队现在给 AI 生成代码设 review 上限了吗——是按 PR 数、按行数还是按风险等级评论区聊一句。附AI 产出验收检查表可直接复制P0 · 发布前必过有自动检查兜底测试 / 类型 / 形式化 / lint吗没有 不入库自动检查覆盖主结论还是全部边界未验证部分明确标注不混在一起交付归因清晰哪些人写、哪些 AI 写、哪个版本回滚路径存在且演练过P1 · 流程层6. review 容量有预算、排队时间被监控吗7. 关键结论有第二独立来源吗重跑 / 交叉实现 / 抽查8. 验收标准写进台账还是口头默契P2 · 生态层9. 你的爬虫 / Agent 流量身份可识别、频率可被限制吗10. 上游被你打挂了有告警和止损吗