首页 > 教程攻略 > ai资讯 >把人类命运挂在嘴边的A社,可能刚刚毁掉人类最后的孤本

把人类命运挂在嘴边的A社,可能刚刚毁掉人类最后的孤本

来源:互联网 时间:2026-07-30 14:24:08

Anthropic就盗版书籍训练AI模型达成和解,同意支付15亿美元天价赔偿金。这起持续近两年的集体诉讼案于2025年7月20日由法院正式批准和解方案,成为AI领域迄今为止金额最高的版权和解案。

根据路透社此前报道,Anthropic在2023年至2025年期间的实际营收仅为50亿美元。15亿美元的和解金额意味着该公司将拿出近三分之一的收入用于解决版权争议。这一赔偿规模在AI公司中尚属首次,引发业界广泛关注。

案件背景

事件的起源可追溯至2021年12月。Anthropic发表了一篇学术论文,详细介绍了其早期大模型的训练数据来源,包括Common Crawl爬取的网页内容以及网络书籍。论文中引用的数据集The Pile及其子集Books3成为本案的关键证据。

Books3子集包含近20万本未经授权获取的电子书。据公开信息,该数据集在AI行业被广泛用于大模型训练,目前已在明面上下架。

2024年,媒体对多家企业使用The Pile数据集训练模型的情况发起调查。面对记者追问,Anthropic发言人承认其商业模型Claude确实使用了包含侵权内容的The Pile数据集进行训练。

这一公开承认直接触发了版权方的集体诉讼。三名作家代表数十万版权人提起集体诉讼,指控Anthropic未经授权使用受版权保护的书籍训练AI模型,并通过商业化模型获利。

诉讼过程中的关键发现

案件正式立案后,原告律师获得了深入Anthropic内部调查的机会。调查发现,该公司使用的侵权数据集规模远超Books3的20万本书籍。Anthropic实际使用的数据集包括LibGen、PiLiMi等,总计涉及至少700万本未经授权获取的书籍。

诉讼过程中还披露了Anthropic另一项引发争议的操作。2024年,Anthropic意识到使用盗版书籍训练存在法律风险后,开始购买纸质书籍。这些书籍被扫描入库后立即销毁,数据集仅限公司内部用于模型训练,不得外传。这一操作符合美国版权法中的“首次销售原则”,即购买者有权处置已购物品,只要不产生新的副本。

然而,这一合法操作反而成为法官认定Anthropic“明知故犯”的依据。法官认为,Anthropic清楚了解如何规避版权风险,却仍然选择使用盗版数据集进行训练,属于故意侵权。

和解方案与执行

法院最终批准的和解方案包括:Anthropic向原告支付15亿美元和解金;在被侵权的作品中,91.3%的作品已被申领,每本被侵权作品可获得约3000美元的和解金。案件已进入判决后的上诉期。

值得注意的是,原告律师最初要求收取和解金的20%(约3亿美元)作为律师费,法院最终将这一比例削减至约1亿美元。

事件影响与后续

此次和解对Anthropic的财务状况构成显著压力。该公司未来可能面临更多版权诉讼。目前仍有部分放弃集体诉讼的版权方,正在分别与Anthropic进行独立诉讼。

该判决为尚未解决的AI版权案提供了参考案例。法院在判决中未对科技公司给予特殊对待,而是直接批准和解方案,避免长期诉讼对各方造成更大消耗。

事件持续引发公众讨论,相关帖子在社交媒体上获得超过2000万次浏览。多位专家学者和行业人士公开批评Anthropic的行为。部分二手书商接受采访时表示,被销毁的书籍中包含一些不常见的绝版书籍,其中部分可能是目前流通的最后版本。

后续需要关注的关键事项

独立诉讼案件的处理结果:放弃集体诉讼的版权方与Anthropic的独立诉讼如何进行,是否达成类似和解方案。

其他AI公司版权案的发展:该判决是否会影响其他AI公司类似版权案件的审理方向。

Anthropic对训练数据策略的调整:该公司是否会改变其模型训练数据的获取方式,以及对版权合规性的投入。

相关业务、价格、合作状态和市场数据可能继续变化,实际情况以企业后续公告为准。

图片、资料来源:

路透社、X、404 media、arxiv、

https://storage.courtlistener.com/recap/gov.uscourts.cand.434709/gov.uscourts.cand.434709.680.0_5.pdf