当代版“焚书坑儒”的判决已出,结果“焚书坑儒”成了判决中唯一被认定合法的部分。
2024年8月到本月20号,持续近两年的Anthropic盗版书训练集体诉讼案尘埃落定。法院裁定,Anthropic需向原告支付15亿美元和解金。
这个金额有多惊人?以路透社报道的数据为准,Anthropic在2023至2025年的营收总和不过50亿美元。这笔和解金几乎是其同期营收的两倍,对这家AI企业而言无异于切断了经济命脉。
这是AI行业首例案件造成的如此重创,无疑起到了杀鸡儆猴的效果。
案件判决书引发关注,其中细节值得玩味。这一切的导火索,要从Anthropic自己递出的"匕首"说起。
2021年12月,Anthropic发布一篇论文,披露早期大模型训练数据来源,主要基于Common Crawl爬取的网页内容及网络电子书。在参考文献部分,The Pile数据集的出现引起广泛关注——当时这个数据集有个Books3子集,包含量近20万本未经授权的电子书,堪称所有大型模型训练的"公共资源"。
虽然Books3子集目前已被公开移除,但彼时Anthropic在版权界的影响微乎其微。
转折点出现在2024年。媒体对The Pile数据集企业应用展开全面调查。面对媒体追问,Anthropic发言人最终承认,商业模型Claude确实使用了侵权内容的The Pile进行训练。
这一承认彻底点燃了版权方的怒火。正如一位原告律师所言:"我们创作的内容被非法使用来牟利,效果可能还要威胁到我们的生计,结果维权连一分钱都拿不到?"
数十万版权人推举三位作家代表提起诉讼。案件立案后,原告团队得以深入Anthropic内部调查。调查发现,Books3只是冰山一角,至少还存在LibGen和PiLiMi两大非法下载资源库,涉及非法下载书籍超700万本。
案件曝光了最让公众诟病却合法的操作——花费数百万美元收购纸质书籍,进行切割扫描构建数据库。这项操作完全符合美国版权法"首次销售原则"的条款:只要获得合法来源的原始介质,后续处置方式不受限制。
但Anthropic的做法显然有失妥当。Google Books曾通过完整扫描电子书的方式获得法院认可,而这家公司却选择将书籍切割成纸页进行破坏性扫描。这种做法或许在避免法律风险的同时,也体现了成本优先的经营理念。
奇怪的是,Anthropic一边呼吁控制AI发展速度,一边却持续进行书籍破坏性扫描。这种明里暗里的矛盾行为,与其说是法律考量,不如说是操作简便的体现。
案件细节曝光后,公众反应激烈。相关讨论在社交媒体上获得超2000万浏览量,评论区接近4000楼。多位学术界权威人士谴责此举"缺乏商业道德",更有人担忧"可能毁掉珍贵孤本"。
一位二手书商在接受采访时透露:"我认识的人都收购过这种书,但现在..."
(文章配图-1)








