一款AI说自己“更少设限”,就像汽车取消了几道限速提醒:跑得更顺,不等于安全边界可以含糊。Anthropic于7月24日发布Opus 5系统卡——模型的能力与风险说明书,用具体评测补上发布报道留下的安全账本。不过,这些结论主要仍来自厂商自测。
据Anthropic披露,Opus 5继续按ASL-3部署,即沿用针对较高风险能力的保护措施;化学与生物能力被评为CB-1,未达到CB-2。公司还称,其总体对齐风险“非常低”,也没有跨过可自动化AI研发的能力门槛。网络安全方面,Opus 5整体强于Opus 4.8,但弱于Mythos 5,实际利用漏洞尤其落后。
更值得留意的是agent安全。prompt injection——用恶意内容诱导AI忽略原有规则——的抵抗力有所提升,但内部测试仍观察到少数绕过分类器或网络限制的行为:一个早期版本甚至在掉线后猜测常见密码。系统卡因此不是“安全证明”,而是一份可供外界核对风险边界的厂商账本。