Anthropic 同意支付 15 亿美元了结盗版书训练集体诉讼
法院批准 Anthropic 向版权方支付 15 亿美元和解金,因其使用数百万本盗版书籍训练 Claude 模型。
Anthropic 因使用盗版书籍训练 Claude 大模型,被美国法院批准支付 15 亿美元(约合人民币逾百亿元)和解金,结束持续近两年的集体诉讼。这是 AI 行业迄今金额最大的一起版权和解案,也被业界视为 AI 训练数据合规的风向标事件。
案件由来:从学术论文到商业化翻车
诉讼可追溯到 2021 年 12 月,Anthropic 发表的一篇论文详细介绍了其早期大模型的训练数据构成,其中引用了一个名为 The Pile 的公开数据集。The Pile 中包含一个叫 Books3 的子集,收录了近 20 万本无版权电子书,几乎所有主流大模型都曾使用过该数据集。
当时 Anthropic 仅将其用于学术研究,版权方并未立即追责。转折点出现在 2024 年:媒体对企业使用 The Pile 训练模型发起大调查,面对记者追问,Anthropic 发言人承认其商业模型 Claude 确实使用了包含侵权内容的 The Pile。这一表态直接点燃了版权方的怒火,三名作家代表数十万版权人发起集体诉讼,案件随后进入正式立案阶段。
案情升级:七百万本盗版书浮出水面
立案后,原告通过证据开示程序深入调查 Anthropic 内部数据来源,发现除了 Books3 之外,还有 LibGen、PiLiMi 等来源,加起来至少有 700 万本无版权或非法下载的书籍被用于训练。
更引人关注的是,Anthropic 在 2024 年意识到盗版书风险后,转而采用另一种方式获取书籍:花费数百万美元从二手市场收购纸质书籍,然后拆掉书皮、切除书脊,进行破坏性扫描构建内部数据集,扫描完成后原书立即销毁,数据集仅限公司内部训练使用。
这一操作之所以"合法",依据的是美国版权法中的"首次销售原则"——只要合法购买了原件,权利人即丧失对复制件的控制权。但与 Google Books 先例形成对比:Google 扫描完整图书、保留原书,被法院认定为合理使用;而 Anthropic 选择破坏性扫描并销毁原物,被舆论批评为"独占人类文明"。
和解金与赔偿分配
根据路透社此前报道,Anthropic 2023 至 2025 年两年实际营收约为 50 亿美元,15 亿美元的和解金几乎相当于其两年营收的三分之一。和解金分摊方式如下:
- 每本被侵权作品约可获得 3000 美元赔偿;
- 原告律师最初要求按和解金 20% 计提费用(约 3 亿美元),被法院砍至 1 亿美元;
- 在被侵权的作品中,已有 91.3% 完成申领。
案件目前处于最终判决后的上诉期。部分放弃集体诉讼的版权方仍以个人身份与 Anthropic 单独交涉,后续可能产生更多赔偿支出。
行业影响:给所有 AI 版权案"打了个样"
这起案件的特殊之处在于,Anthropic"懂版权法"的销毁操作反而向法官证明了其主观上明知盗版风险,却仍选择大规模使用侵权材料,构成"明知故犯",在定罪量刑上被加重考量。法院在整个过程中没有长期反复的法庭拉锯,对科技巨头也未表现出偏袒,判决节奏相当果断。
此案对正在审理或潜在的其他 AI 版权诉讼具有重要参照意义:训练数据的来源合规问题、模型生成内容的风格侵权认定标准、责任主体划分等核心争议,都将受到这一判决结果的间接影响。
围绕此案的舆论持续发酵,相关讨论帖在社交媒体平台浏览量超过 2000 万。马斯克等公众人物也公开表态批评。多家媒体援引二手书商说法指出,部分被销毁的书籍可能是目前流通的最后几本绝版或外文原版。
随着和解落定,Anthropic 的盗版书案告一段落,但 AI 与版权的边界之争远未结束:AI 是否能不打招呼直接使用真人作品训练、风格复刻是否构成侵权、责任如何划分——这些悬而未决的命题,仍将长期定义 AI 公司与创作者之间的关系。
