洱海新闻

数百万本书,被Claude“阅后即焚”

来源:洱海新闻 分类:科技
数百万本书,被Claude“阅后即焚”

厚重的书籍被送入液压切纸机,压板缓缓压下,锋利的刀片精准切割,书脊应声而断。原本紧密相连的书页此刻已变为一叠整齐的纸页。

若你未曾得知内情,单是观看这段视频,或许会感到一种莫名的放松与愉悦。不过,一旦揭示真相——某些人工智能公司正在用类似手法批量处理实体书籍,甚至其中包括那些鲜为人知的冷门书和绝版之作,你恐怕会立刻打消这份闲适。

为了搜寻更多训练素材,AI公司已将目光投向公开网络、盗版电子书,乃至现实世界中的纸质书籍。其中,2022年以前出版的作品尤为珍贵,因它们未混杂AI生成内容,也没有经过现代数据投毒工具的污染,堪称难得的优质数据源。

那些无法在线搜索、缺乏电子版本的低流通量书籍和绝版经典,能提供互联网抓取无法企及的信息,更是上上之选。

Anthropic公司此前曝光的“巴拿马计划”就明确表示,不希望外界知晓其内情。

图书数据库平台ISBNdb公开表示,可为AI企业搜集书籍,称能从旧书店、图书馆及绝版书目录一次性采购千至百万册纸质读物,且会借助保密协议隐匿客户身份及采购清单。

AI公司也清楚这种行为招致非议。

“巴拿马计划”

AI机构将目标对准纸质文献,最初源于Anthropic卷入的一场法律纠纷。

2024年8月,三位作家将Anthropic告上法庭,指控该公司未经授权,利用他们的作品训练Claude模型。

坦白说,此类争议自ChatGPT问世以来就没断过,一点也不出人意料,已有众多相似诉讼案例。

争论焦点在于AI企业利用整个互联网数据进行模型训练是否构成侵权?作者作品若被纳入训练集,是否必须获得本人同意并支付版权金?

因此,在这起诉讼初期,纸质书并非核心议题。

Anthropic为提升Claude的理解与创作能力,首先对公开互联网进行了全面扫描。但网页内容质量参差不齐,于是备受关注的便是经过作者创作、编辑筛选及出版社校对的书籍。

最直接的做法莫过于直接获取电子书。

法庭文件披露,Anthropic曾从Books3、LibGen和PiLiMi等平台下载逾700万册书籍,其中相当部分源自盗版网站。该公司并未将下载文件删除,而是存放于一个长期保留的“中央图书馆”,供未来模型训练和研究使用。

此后,“巴拿马计划”应运而生。该计划的实质是Anthropic大规模采购纸质书籍、实施扫描处理并输入AI系统。

不过,法庭真正关注的核心,是Anthropic获取和使用这些内容的方式是否合法。

2025年6月,法官威廉·阿尔萨普对此案作出判决,对Anthropic十分有利。

在他看来,大模型查阅书籍的目的并非复述或销售原书,而是学习语言、知识与表达技巧,进而生成新内容。这种用途具有显著的转换性质,类似于人类读书后获取知识再进行创作的过程,故可视为合理使用范畴。

关于那些购买来的纸质书,Anthropic已为每本支付费用。公司采取扫描后销毁实体书的方式,仅在内部保留数字副本,并未产生额外市场流通版本。因此法官认定,这方面未侵犯版权。

然而,那700多万册从盗版库下载的电子书则另当别论。

法官认为,训练模型或许属于合理使用范围,但盗版获取途径并不能因此被正当化。使用方式与作品来源是两码事。

美国法律体系中判例具有重要作用,本案法官的裁定为AI企业铺平了道路——即AI可学习人类创作成果,前提是必须通过合法途径获取作品。

由此可见,尽管去年Anthropic购买纸质书并扫描的做法已公开,但法庭及公众的焦点更多集中在老生常谈的“人类知识训练AI的法律界限”问题上。

直至今年,

相关推荐