如果一家餐厅用正规买来的菜谱研究新菜,和从盗版网站下载整套菜谱,法律评价可能并不一样。AI 训练也开始出现这条分界线:问题不只在于模型有没有“读”受版权保护的书,还在于这些书是怎么拿到的。
据 AP 报道,美国联邦法官 Araceli Martínez-Olguín 已批准 Anthropic 一项 15 亿美元的版权集体诉讼和解。案件涉及该公司从盗版网站取得、用于训练 Claude 聊天机器人的书籍。这笔钱覆盖超过 482,000 本书,作者或出版商预计每本可获约 3,000 美元。报道显示,约 91% 的涉案书籍已经有人申领。
15 亿美元买的是什么?
这不是法院给所有 AI 训练行为统一开出的罚单。
集体诉讼允许一大批遭遇相似损害的权利人,由代表原告统一索赔。法官批准和解,意味着法院认为方案对整个群体总体公平,并不等于所有版权争议都已获得完整判决。Martínez-Olguín 在裁定中称,和解为受影响的作者和出版商提供了“有意义的救济”。
15 亿美元是集体和解总额。“每本约 3,000 美元”只是概括性估算,不代表每位作者会固定收到这笔钱。最终分配仍可能受到有效申领数量、费用和分配方案影响。
原告律师 Justin Nelson 将其称为“史上已知最大规模的版权赔偿”。这是当事方的说法。AP 同时将该案描述为数十起 AI 版权诉讼中的首个重大和解,但“重大”并没有统一的法律判定标准。
关键分界:训练与取书是两件事
这起案件最值得注意的地方,是法院把两个环节拆开处理。
此前负责案件的法官 William Alsup 认为,用受版权保护的书籍训练 AI 聊天机器人本身属于合理使用。合理使用(fair use)是美国版权法中的判断框架:法院会综合用途、作品性质、使用数量和市场影响,决定未经许可的使用是否合法。
但 Alsup 同时认定,Anthropic 从盗版网站取得数百万本书的行为违法。换句话说,法院没有全面认定 Anthropic 的训练数据使用合法。它只是认为“拿书训练”这一环节可以构成合理使用,而“从哪里拿到书”需要单独判断。
Anthropic 副总法律顾问 Aparna Sridhar 将前一项结论称为具有里程碑意义,并强调法院认可用书籍训练 AI 属于合理使用。这同样是公司一方对裁决的表述,不能掩盖盗版副本来源带来的责任。
为什么这会改变 AI 公司的账本?
生成式 AI 公司往往需要海量训练材料。过去,争论多集中在训练是否属于合理使用;这次和解把风险进一步落到了副本来源和赔偿规模上。
版权案件在满足条件时,可以适用法定赔偿——权利人不必逐项证明实际损失,而可按每部作品对应的法定金额索赔。训练语料一旦以数十万、数百万部作品计数,来源是否合法就可能迅速变成巨额财务风险。
因此,15 亿美元的重要性不只在数字本身。它给模型公司一个很直观的提醒:即使训练用途获得合理使用保护,盗版获取、保存或整理训练副本仍可能形成独立成本。未来的数据预算,可能不能只计算服务器、人员和授权费,还要计算语料来源核验与潜在版权赔偿。
局限与未知
- 现有供稿只有 AP 一篇报道,关键事实尚无第二个独立信源交叉印证。
- 报道没有披露每本书最终分配金额、费用扣除方式及付款时间表。
- 这是和解获批,不是对所有生成式 AI 训练版权问题作出的普遍判决;其他案件仍可能因事实不同得到不同结果。