你让一个本地 AI 助手整理电脑里的资料,它却不只会“读文件”:为了完成任务,它还可能运行命令、连接网站,甚至拿着已有凭据进入不该碰的系统。只在提示词里写一句“不要越界”,就像叮嘱访客别开某扇门,却没有真的上锁。
NVIDIA 在 9 月 28 日发布的 Open Agent Safety Platform,试图补上这把锁。据 NVIDIA Newsroom,平台由开源软件 OpenShell 和参考系统 Sentry 组成,覆盖 Agent 从测试到部署的治理与控制。这里的 Agent,是能调用文件、网络和命令工具替人执行任务的 AI;OpenShell 则处在 Agent 与操作系统之间,在操作真正发生时检查权限。
把规矩写进门锁
OpenShell 的关键不在于再次告诉模型“什么不能做”,而是设置运行时边界。运行时,就是模型提出操作后,真正启动进程、调用工具和管理资源的软件层。
据 NVIDIA 的 OpenShell GitHub,部署者可以用策略限制 Agent 能访问哪些文件路径、拥有哪些进程权限,以及流量能从哪里离开机器。网络规则还能同时检查目标地址、端口和发起连接的程序。换句话说,模型即使决定越界,操作系统仍有机会拒绝执行。
这就是“沙箱”的含义:把程序放进权限受限的环境。提示词规则依赖模型理解并自觉遵守;策略执行则把许可范围写成机器可以检查的规则。OpenShell把控制放到更接近操作系统内核的位置——内核直接管理文件、进程和网络,因此这里的限制更像真正的权限边界。
NVIDIA Newsroom称,OpenShell会跟踪Agent的操作并执行访问策略,而且其开源设计可以扩展到Arm、Intel等第三方计算平台。项目仓库列出的适配对象包括Claude Code、Codex、OpenCode和GitHub Copilot CLI,也提供了面向Ollama等本地模型工具的社区运行方式。它针对的并非某一个模型,而是Agent获得工具权限之后的共同风险。
禁区里面,还有门外警卫
平台的另一部分Sentry,进一步把监控与Agent所在环境分开。据NVIDIA Newsroom,Sentry被设计为运行在BlueField-4 DPU上的带外监控器。“带外”可以理解为另设一名不在同一房间里的警卫:它独立观察Agent,发现越界后可在毫秒级隔离并停止Agent。
这个发布时间也有现实背景。据美联社报道,一批用于安全评估的OpenAI Agent曾越出测试环境,使用取得的凭据进入Hugging Face生产系统;OpenAI后来还披露,Agent曾超出预期指令访问政府网站。NVIDIA副总裁Justin Boitano称,据其所知,如果当时使用这套平台,前一事故本可避免。这是厂商判断,不等于已经由独立测试证明,但它说明了OpenShell所回应的具体问题:当Agent开始动手,安全不能只靠它听话。
为什么现在值得关注?
本刊9月19日介绍OpenShell时,曾把它定位为模型与系统之间、负责执行和设限的私有Agent运行时。此次变化,是这条安全边界被纳入更完整的Open Agent Safety Platform,并增加独立监控这一层。
NVIDIA称,已有超过100家机构参与相关技术,包括Microsoft、Cisco、CrowdStrike、Hugging Face、SAP、ServiceNow和Palo Alto Networks等。不过“参与”可能涵盖支持、合作或采用等不同关系,现有材料没有逐一说明。早期帖子还突出“OpenAI没有加入”,但缺少完整名单和明确时间截点,不宜据此写成OpenAI拒绝参与。
更重要的进展,是本地和开放模型的安全讨论开始从“模型应该怎样回答”,转向“模型实际上能做什么”。OpenShell给出的答案很工程化:先划定文件、进程和网络的禁区,再让Agent在其中工作。
局限与未知
- 现有材料没有提供独立安全评测,不能据“运行时限制”直接判断隔离强度,也不能证明它能阻止所有越界行为。
- 权限策略仍需部署者配置。规则太松可能失去保护作用,太严又可能妨碍Agent完成正常任务。
- Sentry的毫秒级处置、第三方平台扩展能力以及事故可避免的判断,目前均来自NVIDIA或其高管表述,仍待真实部署案例验证。