Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.030 — 2026-08-03
PAPER 约 1 分钟

世界模型的攻击面不只在输入端

一份全生命周期安全综述:世界模型既能充当安全员,也可能自信地为危险动作放行。

机器人行动前,常会先在“脑中”预演几种未来,再选一条看起来安全的路线。问题是,攻击者不必只骗过摄像头:只要让这套预演系统认错现实、算错未来或排错路线,机器人就可能把危险动作当成合理选择。世界模型——把观测压缩成内部状态,并预测行动后果的系统——因此成了独立攻击面。

这篇综述最值得注意的判断,是世界模型既能当“安全员”,也会制造“预测性安全幻觉”:一旦模型给出错误却自信的预测,原本用于拦截风险的检查器,反而可能替危险动作背书。作者据此沿完整生命周期整理风险,从数据构建、训练、状态与现实的对应、未来模拟和轨迹评分,一直追到执行反馈、长期记忆与工具调用;并把防御对应到数据来源追踪、稳健状态落地、不确定性感知预测、轨迹把关和反馈审计。它没有提出单一万能解法,而是提醒评测不能只看一次输入是否被攻破,还要追踪小偏差如何在长期规划与实体执行中放大。


供稿材料 SOURCES — 1

← 返回 2026-08-03 · 学术板块