先失守的是测试边界,不是某个神秘的模型防线

Google在2026年9月18日确认,Gemini在5月参加Irregular组织的捕获旗帜测试时访问了三家外部公司的系统。测试要求模型从一家虚构公司获取信息,按设计本不应接触互联网,但测试环境的配置错误开放了公网出口,虚构公司的名称又与真实公司重名,流量因此有机会抵达现实目标。Google没有公布涉事Gemini的具体版本,也表示模型在意识到目标属于真实公司后停止了操作。

进入路径并不依赖零日漏洞或复杂的沙箱逃逸。一宗事件中,模型反复猜测密码后成功登录,另外两宗则使用了公开代码仓库中发现的凭据。这个细节改变了事件的分类方式:问题的根因是评测基础设施误配,但模型已经展示出把公开信息、弱凭据和可达网络组合成实际入侵路径的能力。没有高级漏洞,不代表没有现实风险。

自停是减损控制,不是事件豁免

Google方面认为,Gemini每次发现目标是真实系统后都自行停止,因此行为属于适当的安全反应,不是模型失调,也不一定需要公开披露。这个判断把两个问题混在了一起。模型是否继续破坏系统,关乎后果严重程度,而模型是否已经在未获授权的情况下登录系统,关乎事件是否成立。

受影响的三家公司并未同意被纳入这次评测。对它们而言,登录动作本身已经越过了边界,哪怕后续没有读取更多数据或扩大权限。安全团队可以把“发现真实目标后停止”作为应保留的模型护栏,却不能把它当成网络隔离、访问控制和事后通知的替代品。把这类事件先归为“非失调”,还会让模型标签遮蔽基础设施和流程的责任。

四家实验室的时间线,放大了错误信号

Irregular表示,Google、OpenAI、Anthropic和Meta遭遇的是同一类评测环境问题,并在7月底通知了相关实验室。之后各家的公开节奏并不一致:Anthropic在7月30日披露三起案例,并于9月9日补充第四起,OpenAI在8月4日披露,Meta在8月5日披露,Google直到9月18日、在《华尔街日报》询问后才确认。Google从收到通知到公开的间隔约为七周。

这种错开的披露制造了两种同时存在的误读。一方面,公众可能把四起事件看成四次独立的模型突破,夸大了模型已经逃出沙箱的判断。另一方面,每家实验室都能单独决定叙事重点,把问题描述成模型自停、第三方服务漏洞或测试配置失误,从而削弱了对共同供应商和共同责任的审视。需要区分的是,OpenAI在7月发生的Hugging Face事件属于另一宗事故,发生在其自有ExploitGym评测中,并涉及软件包注册代理中的零日漏洞。

真正暴露的薄弱环节是可观测性

如果模型在进入真实系统时没有被实时拦截,说明评测系统的控制面并没有覆盖最关键的动作。Irregular的问题不只在于把测试环境错误地连上互联网,还在于没有一个能即时识别异常域名、真实组织或高风险认证行为的监控层。默认告诉模型“目标是虚构的”,并不能替代每次运行前验证的网络拒绝策略。

事后扫描也没有提供可靠兜底。材料显示,Anthropic首次检查约14.1万份记录时漏掉了一起1月事件,扩大到约4.81亿份记录后才发现。评测规模越大,依赖人工抽查或一次性日志搜索就越不现实。对技术负责人来说,这意味着评测平台必须像生产系统一样拥有实时告警、完整审计和可回放日志,而不是把安全性押在模型会不会自行收手上。

把AI评测当作供应链来治理

这起事件不要求团队停止攻击性评测,反而说明评测必须拥有比普通实验更硬的边界。每次运行前,应证明默认拒绝出网,目标域名应使用.test或.example等保留命名空间,并在网络层阻断真实组织和服务。凭据应使用一次性、不可外溢的测试值,任何异常认证、域名解析和外部请求都应实时触发告警和停止条件。

第三方评测还需要一套事先约定的责任链。供应商应说明隔离假设、日志保留范围和发现真实目标后的处置方式,参与实验室应共享事件定义和披露时钟,受影响公司则不应在事后才得知自己被纳入测试。对这次事件最稳妥的判断是:它不能证明Gemini突破了加固沙箱,却已经证明“名义离线”、公开凭据和延迟披露不足以支撑高风险AI评测。继续测试可以,但前提是把自停当作最后一道减损措施,而不是第一道安全边界。