Expanding OpenAI Academy with new learning paths — cover
来源材料 查看原始材料 ↗
Introducing the Australian Youth Safety Blueprint — cover
来源材料 查看原始材料 ↗
Introducing Astra for Law — art card
来源材料 查看原始材料 ↗

先看清楚:这不是一次模型发布

OpenAI在2026年9月21日宣布成立独立的“数学与人工智能顾问组”,由来自高等师范学校、普林斯顿高等研究院、EPFL、牛津、斯坦福、哈佛等机构的数学家组成。公告的背景是,OpenAI称其于8月28日开始训练一个新的内部模型,该模型除了解决Navier–Stokes存在性与光滑性千禧年大奖问题,还解决了100多个、覆盖数学大多数领域的长期开放问题。这里的关键事实来源只有OpenAI自己的公告,材料没有提供这些结果的证明、问题清单或外部同行验证记录。

这次变化值得读,不是因为一个未经公开验证的数字足以证明数学能力已经跨过某个门槛,而是因为OpenAI已经把问题从“模型能不能做数学”推进到了“机器产出的数学何时算作可传播的知识”。公告承认,模型进展速度令公司内部数学家感到意外,也承认解决开放问题作为新系统基准可能产生负面外部性。顾问组因此被安排在结果产生之后、进入学术共同体之前,承担一种科学合法性接口的角色。

顾问组审查的不是分数,而是知识如何成立

OpenAI给顾问组的任务包括评估新结果的重要性、建议如何协调传播,并就数学研究与职业规范提供意见。这三项工作对应三个不同层次。结果是否正确,首先需要证明或推导能够被数学家复核;结果是否重要,涉及它改变了什么问题、方法能否迁移,以及是否真的超出已有工作;结果如何传播,则涉及何时公开、向谁公开,以及怎样避免把尚未稳定的发现包装成已完成的科学成果。

这也是为什么“解决了100多个开放问题”本身不是一个充分的技术指标。开放问题的难度、表述方式、已有部分结果和证明所依赖的工具都可能不同,数量无法替代逐题的可复核证据。尤其是Navier–Stokes问题被视为千禧年大奖问题之一,若要让数学共同体接受相关主张,关键不会只是模型是否给出一个答案,而是证明是否完整、是否能被独立检查、是否包含人类研究者能够理解和继续使用的结构。公告尚未提供这些信息,顾问组的设立恰恰说明这些信息仍是必要环节,而不是发布后的附属说明。

独立性有边界:它更像科学基础设施,而不是能力刹车

公告对独立性的描述相当具体。顾问组可以提出OpenAI没有主动要求的意见,可以公开评论OpenAI对数学的影响,成员不由OpenAI付酬,也可以自行调整成员构成。OpenAI明确表示,顾问组的价值取决于成员能否运用自己的判断并挑战公司判断。这些安排试图避免顾问组沦为发布会背书机构,至少在形式上把同行批评纳入了机制设计。

但独立咨询不等于独立监管。OpenAI同时明确,顾问组不负责建议公司如何安排内部数学进展的速度。也就是说,顾问组可以评价结果、讨论传播标准、批评公司的影响,却没有材料所显示的暂停训练、限制访问或推迟部署的决定权。这个边界改变了对该机制的正确期待:它可能提高结果进入学术界时的透明度与合法性,但不能单独承担能力控制或风险处置。

对研究机构而言,入口流程比排行榜更重要

如果OpenAI所描述的进展属实,数学研究机构面对的首先不是如何追逐一个更高的模型分数,而是如何接收机器提出的候选结果。一个可执行的入口至少要区分三个动作:证明复核、研究意义判断和传播决策。三者不能由同一份演示或同一个总榜分数替代,也不能因为模型声称解决了著名问题,就默认其结论已经取得学术地位。

这会直接影响研究团队的工作方式。团队需要保留足够的中间推理、形式化证明或可检查材料,记录哪些部分由模型产生、哪些部分由人类修改,并为独立复核预留时间和权限。若机器生成结果被用于论文、课程或研究工具,署名、责任归属和错误追踪也需要在发布前说清楚。OpenAI目前只宣布顾问组会就这些规范提供建议,并未公布一套已经生效的流程,因此这些仍是需要共同制定的制度问题。

真正的判断点还没有出现

目前最重要的未知数很明确:Navier–Stokes解答是否已经经过外部数学家验证,100多个问题具体是什么,模型给出的证明是否具备可理解、可复用和可独立检查的形式。材料没有说明新模型的名称、架构、训练方法、访问方式或部署路径,也没有给出任何一项结果的证明文本。因此,不能把这次公告写成数学能力已经被共同体确认的结论。

更准确的判断是,OpenAI正在为一种可能出现的研究现实提前搭建发布与问责机制。顾问组能否发挥作用,取决于它是否愿意公开不同意见,外部数学家是否能获得足够材料复核,以及OpenAI是否会把批评转化为传播限制、证据补充或流程修订,而不只是将其作为声誉背书。对技术负责人和研究机构而言,眼下可执行的原则很简单:把机器的“已解决”当作待审计的研究输入,把证明可复核性和责任链放在能力演示之前。