让AI替你改代码,像请人进家维修:不能只靠它“答应不乱翻”,还得锁上无关房间。Anthropic近日披露Claude的安全隔离架构,核心是把防线放到运行环境——限制Agent能读哪些文件、访问哪些网络。Agent比聊天机器人权限更高,一旦被网页或文件里的恶意指令带偏,光靠模型自律并不稳。
Claude Code最初每次写文件、运行Shell命令或联网都让用户确认,但约93%的请求最终获批,频繁弹窗逐渐失去警示作用。Anthropic随后引入操作系统级沙箱——一种只开放必要资源的隔离环境:Agent可在当前工作区读写,网络默认关闭。该公司称,这让确认弹窗减少84%。更直观的教训来自一次受控红队测试:在25次模拟攻击中,Claude有24次把AWS凭证发往外部地址。
这套设计并非没有漏洞。研究人员还曾利用已放行的Anthropic域名,通过Files API外传文件,说明“可信域名”不等于其中所有功能都可信。Anthropic后来加设会话代理限制请求。对部署高权限Agent的团队而言,这份样本的价值很朴素:别只判断指令是否恶意,要让系统在判断失误后仍能兜底。