


发布者真正提出的,不只是“要更安全”
OpenAI在2026年9月21日发布《Building standards for the next phase of AI》,把这份主张放在自身使命和研发路线中说明。公司称其使命是让通用人工智能惠及全人类,并把工作概括为三个方向:应对下一阶段的AI进展,交付高度智能机器带来的科学与经济收益,以及让每个人都能获得个人化的AGI。这里最关键的是第一个方向,它不是简单提高模型能力,而是建设一个自动化AI研究员,让AI参与后续AI系统的研发,同时继续研究对齐问题,并设法让人类留在自我改进循环中。
这一路线已经不再把AI看作只服务于外部用户的工具。材料称,AI正在加速OpenAI自身的研究和工程工作,AI参与的研究已经带来数学方面的进展,并提到Navier–Stokes千禧年问题。无论这些成果最终能扩展到什么程度,治理难题都已经发生了变化:当系统开始承担研究、工程和安全研究的一部分工作,风险不只来自最终模型的行为,也来自研发链条本身不断缩短、加速和变得难以解释。
从模型验收到研发过程:治理对象发生了迁移
材料把这种变化概括为递归自我改进,也就是AI系统越来越多地驱动自身后续开发。它同时明确给出一个重要限定:完全自主的递归自我改进目前并没有发生,除非能够安全实现,否则不应主动推进。这里的判断并不是把RSI当成已经到来的产品能力,而是把它当成会改变进展速度和控制难度的潜在机制。自动化AI研究可以包含不同程度的人类监督,随着AI承担更多后续AI研发工作,研发过程可能逐渐接近由系统自身推动的循环。
这使“人在环中”变成一个需要重新定义的工程问题。材料并没有把有人参与等同于安全,而是警告,如果人类已经无法监督自己不再理解的研究过程,实际控制权可能已经丧失。形式上保留审批人,并不能证明审批人仍然理解关键实验、代码变更或能力跃迁的因果关系。对技术负责人而言,监督点不能只记录谁点击了批准,还必须能够说明人类看到了什么证据、能够否决哪一步,以及自动化流程在什么条件下必须停下来等待复核。
标准要统一的,是证据而不是口号
OpenAI提出国际安全标准,核心理由不是各国都需要重复同一套法律,而是前沿AI开发需要共同的技术底座。材料把标准的作用说得很具体:建立对高质量证据的共同定义,为技术保障措施规定可比较的严谨基线,并帮助回答“缓解灾难性AI风险,什么才算做得足够好”。这意味着标准至少要覆盖能力测量、风险评估、保障措施是否充分,以及事故如何定义和报告。
这种安排的价值在于让不同实验室、公司和国家的进展能够放在同一张仪表盘上比较。材料列举的方向包括监测自动化研究的规模,评估递归自我改进取得了什么进展,记录人类监督处于什么程度,并规定哪些自动化流程必须触发即时人工复核。这里的“标准”不是一句“遵守安全原则”,而是把研发活动转换成可以审计的对象。公司需要说明自动化系统承担了多少研究工作,哪些风险评测产生了什么证据,事故是否按共同定义上报,以及人类监督是否仍然具有实质性的否决能力。
国际协调的现实:标准有用,但并不自动有权力
材料把现有民主机构和新型公私合作都放在可能的制度基础上,包括美国的Center for AI Standards and Innovation,也就是CAISI,州级法律和联邦层面的AI框架。已给出的背景信息还提到,CAISI在2024年组建了一个国际网络,列举了10个国家的AI安全机构。这样的网络可以帮助各国对齐测量、评估和报告方法,但材料没有表明它本身拥有替各国发放许可证或强制暂停研发的权力。
这一点决定了标准的实际形态。现有信息明确指出,方案不是许可证制度,也不是统一的强制预审,是否写入法律仍由各国自行决定。标准首先提供跨境可比和问责的共同技术语言,国家法律再决定哪些要求具有强制力。对跨国公司和开放权重模型开发者来说,这既意味着不能把一次标准评测当成全球通行证,也意味着越早参与指标和事故定义的形成,越可能影响未来的合规成本、部署路径和市场准入条件。
技术负责人现在就能做的准备
这份材料还不足以回答几个关键问题。它没有说明自动化研究规模应按计算量、研究任务数量、代码提交比例还是实验决策权来衡量,也没有给出人类复核何时必须触发的阈值。材料还提到OpenAI披露的Hugging Face事件可以预示更严重的风险,但所给内容没有展开事件经过,因此不能据此推导具体攻击路径或安全结论。对齐研究能否跟上能力增长,也仍然是主张中的待验证条件,而不是已经完成的保证。
但团队不必等到国际规则定稿才开始准备。可以先把自动化研发拆成可审计的活动,记录AI参与了哪些研究任务、改变了哪些代码或实验计划、产生了哪些能力和风险证据。对涉及模型自我改进、自动生成研究方案或大规模安全评测的流程,应预先定义人工否决点,并让事故报告接口能够保留上下文、责任归属和复核结果。这样的内部机制不能替代法律,也不能证明系统已经安全,却能把“人类控制”从组织口号变成可检查的工程约束。
最终的判断边界也很清楚。国际标准有机会解决证据不可比和跨境问责不足的问题,但它同时可能成为竞争门槛,因为谁来定义“足够证据”和“可接受风险”,谁就会部分影响前沿研发的速度。更重要的是,标准不能修补一个监督者已经无法理解的研发循环。技术负责人应把标准当作共同测量和提前暴露失控点的基础设施,而不是把合规通过当成安全终点。