你让 AI 自己找数据、跑统计、下结论,它却可能像拿到假账本的审计员:计算过程看似认真,答案从源头就被带偏。Nature 报道的一项预印本研究测试了这种“数据投毒”——攻击者有意修改 Agent 信任的数据,使分析结果转向预设结论。
研究者选取涉及移民与生育率、招聘歧视、警务中的种族差异等五类争议议题,改动数据以改变统计趋势的方向和强度,再让 Anthropic、OpenAI 和 Google 的自主分析 Agent 同时搜索原始版与篡改版。结果显示,Agent 平均约有一半时间采信了篡改数据,并得出攻击者想要的结论。更值得警惕的是,研究者还发现,只需修改 README——说明数据内容和用法的文件——声称原始数据有误,就可能诱使 Agent 完全忽略原版。
这说明 Agent 的风险不只来自藏在网页里的提示注入,也来自科研材料本身的“供应链”。数据出处像履历,完整性校验像封条;自动分析越深入,这两道检查越不能省。该研究尚未经过同行评审,目前更适合作为风险演示,而非对所有 Agent 的最终定论。