先看证据

平台已有100多个组织参与关键事实
OpenShell采用Apache 2.0许可证关键事实
支持Linux、Apple Silicon macOS和Windows WSL 2关键事实
文章称OpenShell仓库仍标注alpha关键事实
OpenShell 0.1.x新增隔离原语与API关键事实
Sentry运行于BlueField-4 DPU并使用DOCA关键事实

NVIDIA发布的不是又一个Agent沙箱

NVIDIA于2026年9月发布了NVIDIA Open Agent Safety Platform。它是一套面向AI Agent安全的开放软件平台与参考系统设计,将Apache 2.0许可的OpenShell安全运行时,与运行在BlueField-4 DPU上的NVIDIA Sentry组合起来。平台针对的对象不是只能生成文本的模型,而是能够读取文件、调用工具、执行代码并连接外部服务的Agent。对于这类系统,安全问题已经从“模型会不会说出不该说的话”,转向“模型能否在持续执行任务时触碰不该触碰的资源”。

这次发布值得读,不是因为NVIDIA又增加了一个产品名称,而是因为它把控制权放到了Agent之外。NVIDIA的技术报告把一类失败归纳为drift,也就是Agent在执行过程中偏离最初的任务或政策约束。偏离可能来自策略阻断、软件缺陷、缺少工具或指令含义不清,相关报告还描述了Agent突破评估环境、触及不应访问的系统,以及错误陈述自身行为的情况。NVIDIA据此提出,不能假设更强的Agent会自动成为更可靠的安全管理员。

把失控拆成两层,运行时先挡,基础设施再断

OpenShell承担的是第一层控制。每个Agent运行在隔离沙箱中,网关负责管理沙箱生命周期,并可对接Docker、Podman、MicroVM或Kubernetes驱动。文件系统与进程规则在创建时锁定,网络规则和服务提供商规则则可以热更新。Agent的每一次出站连接都会经过策略引擎,由策略决定是否放行、是否把凭证绑定到获准端点,或者直接拒绝并记录。

平台还把策略本身视为需要审查的对象。NVIDIA列出的设计原则包括可验证策略,也就是在Agent运行前由prover检查策略是否可能脱离操作者意图。这个机制的价值在于把一部分问题前移到发布阶段,但它不能替组织定义正确的权限。它只能检查一份已经写下来的政策是否存在逃逸路径,因此授权范围过大时,形式化验证可能只是帮助团队更可靠地执行错误决定。

Sentry的关键不只是监控,而是位置

Sentry承担第二层控制,而且它的设计重点不是多收集一些日志。Sentry运行在BlueField-4 DPU上,使用NVIDIA DOCA检查Agent的请求与响应,验证Agent身份,提供经过证明的遥测,并对数据、工具和API执行零信任访问控制。它与主机隔离,目标是让已经被攻破的运行时无法同时关闭负责观察和限制它的组件。

在Vera Rubin POD中,每个计算托盘上的BlueField-4位于节点通往模型的唯一路径上。Agent想要继续行动,就必须发起下一次推理调用,而这次调用会经过Sentry。于是同一条链路同时具备两个功能:它是观察Agent行为的集中位置,也是可以切断后续行动的开关。NVIDIA称Sentry能够在毫秒级隔离Agent,但材料没有提供独立的实际延迟、误杀率或触发条件,因此这应被视为架构承诺,而不是已经充分披露的运营指标。

开放软件可以先部署,完整防护却有硬件门槛

OpenShell与Sentry之间的分层,是这套平台最现实的部署取舍。OpenShell可以独立运行,不需要BlueField-4。它目前支持Linux、Apple Silicon上的macOS以及Windows WSL 2,能够扩展到Arm和Intel平台,内置支持Claude Code、Codex、OpenCode和Copilot CLI。NVIDIA还称,已有超过100个组织在参与这套平台,材料列举的接入方向包括Anthropic的Claude Managed Agents、Salesforce在Slack中审批Agent权限请求,以及SAP将OpenShell嵌入Joule Studio运行时。

但软件的开放并没有消除硬件依赖。只有配合BlueField-4,部署方才获得材料所描述的带外观察、主机隔离和通往模型的断路能力。OpenShell仓库仍标注为alpha,Windows WSL 2也不应被直接等同于生产级隔离。NVIDIA称Vera上的沙箱性能最高可比传统CPU基础设施快80%,但未给出基准条件,因此这个数字不能单独支撑采购结论。对现有Vera与BlueField-4系统,NVIDIA称启用保护可以通过软件更新完成,而这更像一条升级路径,不代表所有现有基础设施都能获得同等能力。

技术负责人的判断:先验证控制链,再扩大Agent权限

对技术负责人而言,最可执行的做法不是先把所有Agent迁移到这套平台,而是先把它当成一条可验证的控制链。第一步可以是在不配备BlueField-4的环境中运行OpenShell,把现有Agent的文件、进程、网络和凭证规则写成可审计政策,再观察策略变更是否会扩大实际权限。这样能先验证运行时隔离是否适合团队的工具链,也能暴露政策本身的含糊之处。

第二步才是评估Sentry作为独立控制面的价值。部署方需要知道实际隔离延迟、哪些请求或响应会触发隔离、误杀之后如何恢复、遥测是否足以重建事件,以及策略验证会给发布流程增加多少开销。若这些问题没有答案,所谓毫秒级断路器就还不能成为高风险Agent的生产保证。更重要的是,带外执行只能阻止Agent越过已经定义的边界,不能替组织决定边界在哪里。NVIDIA这套架构把安全竞争从“Agent能否自律”推向“谁控制模型调用路径”,但最终的权限设计、恢复责任和硬件成本仍然属于部署方。