Daybreak for Critical Infrastructure — cover
来源材料 查看原始材料 ↗
Path to Astra — Clean square cover — Neutral Option 062 v1
来源材料 查看原始材料 ↗
Source figure
来源材料 查看原始材料 ↗

先看证据

活动始于2026年7月1日关键事实
7月24—25日出现1.6万次提取请求关键事实
高峰请求来自超4000名用户关键事实
关联提示模式涉及超1.5万名用户关键事实
相关活动于7月28日前被完全中断关键事实
论文分析315,320个加密推理块关键事实

把机制串起来

输入先把素材压到可处理的规模

模型的“隐藏推理”是生成答案时的中间工作记录,通常不直接展示给用户;最终答案只是经过筛选后的输出。知识蒸馏则是用强模型的大量输出训练或改进另一个模型,若拿到推理轨迹,学生模型能学到更细的解题过程。所谓对抗性蒸馏,是未经授权、规模化地抽取这些输出或推理来复制能力。客户端加密并不等于服务器端密文天然安全,关键还要看密文能否跨会话、跨模型被复用。

机制再把计算集中到关键步骤

攻击的关键不是破解加密算法,而是把某模型产生的加密推理块带到另一会话,再让同一供应商体系内较弱或防护较少的模型把它解码并逐字输出。若密文格式、密钥使用方式或上下文协议在模型间兼容,密文就从“不可读记录”变成了可迁移的输入对象。较弱模型往往没有原模型同等的拒答策略,于是攻击者绕过了对强模型直接越狱的防线。规模化后,提取出的推理可用于训练复制模型,也可能暴露原本被最终答案遮蔽的危险信息、个人数据或凭据。代价在于,跨会话隔离、模型级密钥、服务端验证和输出过滤都可能增加延迟、存储、工

结果最后落到可验证的工作结果

['不要把客户端加密推理块视为不可泄露秘密', '高价值推理应服务端保存或使用不可跨模型复用的令牌', '对跨用户、跨会话复用密文和异常提取模式告警', '需兼顾安全与可验证输出,避免暴露完整CoT']

攻击者没有攻破数据库,而是改造了提问方式

OpenAI在2026年9月30日披露了一次协调性的模型蒸馏行动。该行动最早于7月第一周出现,目标是提取模型受保护的推理内容,再以未经授权的方式帮助训练、复现或改进另一套模型。这里的“受保护推理”指模型处理任务时的内部工作记录,其中可能包含最终回答中被刻意隐藏的信息。

这次行动没有表现为加密被破解、数据库被入侵,或直接取得用户对话存储。OpenAI称,操作者通过操纵模型交互,让原本不应向请求者展示的推理以可见形式被重建,并以协调、规模化的方式持续进行。攻击面因此不在模型权重的静态存储处,而在模型如何响应精心设计的请求,以及不同会话之间如何处理被保护的中间内容。

关键路径是跨会话重放,而不是单次提示词越权

披露中最具体的技术路径,是操作者先从一个会话复制加密的推理内容,再在另一个会话中要求模型解密并转录隐藏推理。这个过程利用的不是传统意义上的密钥泄露,而是系统允许某些已持有的加密内容重新进入模型交互后,仍有机会被恢复其语义。独立安全研究人员也通过负责任披露报告了相关的跨模型和会话压缩漏洞,OpenAI称其验证了这些攻击路径确实存在。

这说明“加密”本身并不等于端到端的保护。如果密文可以被搬运到新的上下文,如果模型会把不应外显的内容转换成普通文本,或者流式输出在生成过程中缺少拦截,那么攻击者可以把多个看似无害的动作拼成提取链路。对技术负责人而言,审计对象不应只是单条提示词,而应是内容在会话、用户、工作区、组织和模型家族之间的生命周期。

规模证据显示,这不是零散的越权尝试

OpenAI给出的时间线显示,活动在7月1日以低流量开始,7月24日和25日出现高流量峰值。两天内,相关提取模式产生了16,000次请求,涉及超过4,000名用户。进一步调查又在超过15,000名用户组成的网络中发现相关提示模式,OpenAI称已在7月28日前将这组活动完全阻断。

这些数字不能直接等同于被成功提取的推理量,也不能证明所有参与者来自同一组织。OpenAI明确表示,相关时期观察到的所有操作者是否属于单一行为者仍不清楚,但将其中一个核心活动集群归因于与Kimi开发者Moonshot AI有关联的个人。这个归因边界很重要,因为它把“观察到的攻击模式”“用户网络规模”和“具体组织责任”分成了三个不同层次,不能混为一谈。

防线必须同时覆盖账户、输出和行业协作

OpenAI表示,处置并非依赖单一规则,而是组合了账户执法、技术控制和合作方协调。具体措施包括封禁或限制欺诈账户,加强注册与基础设施控制,扩大对相关网络的监测,并为不同用户、工作区、组织和模型家族强化隐藏推理保护。系统还关闭了一条允许攻击者重放他人加密推理并恢复内容的路径,并增加了对可能暴露推理的流式输出进行检测和暂存的检查。

这套组合反映出一个实际的架构判断:账户层适合处理身份和滥用规模,内容层适合阻断不应外显的结果,基础设施层则用来识别重复注册、协同网络和流量突变。任何一层单独工作都可能留下缺口。OpenAI还通过Frontier Model Forum向行业伙伴分享相关信息,原因正在于这类操纵并非其模型独有,单个平台的封禁无法消除跨模型迁移的风险。

对模型提供方和使用方,判断标准都变了

模型提供方不能再把“最终答案没有泄露内部推理”视为充分保护。只要中间状态能被跨会话重放、由另一个模型解释,或在流式输出的瞬间暴露,受保护能力就可能被低成本地收集。尤其当模型进入双重用途领域,蒸馏可能让其他系统在没有承担同等安全投入的情况下更快获得先进能力,风险也就不再只是商业竞争或服务条款问题。

对部署方而言,最可执行的判断是把受保护推理当作高敏感度中间资产来治理,而不是把它当成普通上下文。需要持续测试跨会话、跨模型和会话压缩路径,也要把异常请求模式、账户网络和流式输出联动起来观察。与此同时,这次披露并没有给出成功提取量、具体模型损失或所有活动主体的确定结论,因此在做归因、损害评估和安全承诺时,必须把已确认的攻击路径与仍在调查的影响范围分开。