数百万本书,被Claude“阅后即焚”腾讯新闻

8/1/2026

一本厚书被推进液压切纸机,压板落下,刀片切下,书脊被干脆利落地削掉。原本连接在一起的书页变成整齐的一沓纸张。

如果没有任何解释,看到这样一段视频,你甚至可能会觉得“引起舒适”、非常解压。

可如果告诉你,AI公司正在用这套办法成批处理纸质书,其中还可能包括冷门书和绝版书,相信你八成就舒服不起来了。

为了寻找更多训练数据,AI公司已经从公开互联网、盗版电子书,一路找到了现实世界里的纸质书。其中,2022年以前出版的书因为没有混入AI生成内容,也没有经过现代数据投毒工具处理,成了难得的“上品”。

那些网上搜不到、没有电子版的冷门书和绝版书,能够提供互联网抓取不到的内容,更是“上上品”。

Anthropic被曝光的“巴拿马计划”中明确说不希望外界知道。

图书数据库公司ISBNdb公开宣称,可以接活儿给AI公司找书,能从旧书店、图书馆和绝版书目录中,一次采购1000至100万本纸质书,还会通过保密协议藏住买家身份和采购书目。

AI公司也知道这事儿“不好看”。

“巴拿马计划”

AI公司开始盯上纸质书,最早是从Anthropic惹上的一场官司里露出端倪的。

2024年8月,三名作家把Anthropic告上法庭,指控它未经授权,用他们的作品训练Claude。

说实话,这类争议其实从OpenAI搞出个ChatGPT开始就没停过,一点也不新鲜,类似的官司也已经有不少。

争议在于AI公司把整个人类互联网抓去训练模型,到底算不算侵权?作者的书进了训练集,要不要经过本人同意、支付版权费?

所以在这场官司里,纸质书一开始压根不是主角。

为了让Claude懂得更多、写得更好,Anthropic先把公开互联网扫了一遍。但网页里的内容良莠不齐,因此经过作者写作、编辑筛选和出版社校对的书籍被盯上了。

最方便的办法,当然是直接找电子书。

法庭材料显示,Anthropic曾从Books3、LibGen和PiLiMi等资源库下载超过700万本书。这里面相当一部分来自盗版网站。公司并没有用完就删,而是把这些文件存进一个长期保留的“中央图书馆”,准备供未来的模型训练和研究继续使用。

随后,一个内部代号为“巴拿马计划”的工程启动了。这个计划简单来说就是Anthropic大规模购买纸质书、扫描并喂养AI。

不过在当时,法庭真正关心的是Anthropic获得和使用这些内容的方式是否合法。

2025年6月,法官威廉·阿尔萨普给出了一套对Anthropic相当有利的判断。

在他看来,大模型读取一本书,并不是为了向用户复述或出售这本书,而是从中学习语言、知识和表达方式,再生成新的内容。这种用途具有很强的“转化性”,和人读过一本书之后获得知识、再去创作有些类似,因此可以认为在合理使用的范围内。

至于那些买来的纸质书,Anthropic已经为每一本付过钱。公司扫描一本,就销毁对应的实体书,只在内部留下一个数字替代品,没有多制造一份拿到市场上出售的副本。法官因此认为,这部分也没有侵犯版权。

但是那700多万本从盗版资源库下载的电子书就说不过去了。

法官认为,训练模型可能属于合理使用,却不能反过来证明盗版获取也是合法的。你怎么用书是一回事,这本书怎么到你手里,是另一回事。

在美国法律体系中,判例的作用是巨大的,这位法官的判例为AI公司开了一条路,那就是AI公司可以学习人类写下的作品,前提是先用合法方式把作品弄到手。

所以可以看到,在去年的Anthropic官司里,虽然其购买纸质书并扫描的做法已经公之于众,但是法庭及大众的关注点还是更多在老生常谈的“用人类知识训练AI的法律边界”上。

直到今年,两篇报道接连出现,大家才突然意识到问题的严峻性。

绝版纸质书永远消失?

今年1月,《华盛顿邮报》从4000多页刚刚解封的法庭材料中,挖出了“巴拿马计划”的更多细节。

Anthropic在一年左右的时间里花费数千万美元,买下数百万本纸质书。供应商切掉书脊,将散开的书页送进高速扫描仪,最后再把剩下的纸张交给回收公司。仅一份项目方案,就计划在半年内处理50万至200万本书。

规模已经足够惊人,Anthropic内部文件里的两句话更要命:

“巴拿马计划,是我们对全世界所有书籍进行破坏性扫描的行动。”

“我们不希望外界知道我们正在做这件事。”

这两句话放在一起,整件事就很难看了。

Anthropic向来强调AI安全、道德和责任,结果却在背地里启动了一项毁掉数百万本书的秘密工程。

切书原本还可以解释为一种追求效率的扫描方式,“不希望外界知道”则让人很难不怀疑:Anthropic自己也清楚,这件事一旦公开,绝对说不过去。

Anthropic到底偷偷毁了多少书?

《华盛顿邮报》没有拿到完整书目,外界也不知道这些书里有多少是随处可见的畅销书,多少已经停止再版。人们震惊于工业化切书的规模,还很难判断它究竟造成了什么具体损失。

半年后,404 Media的一篇报道,把担忧聚焦到了绝版书身上。

报道的主角叫ISBNdb,一家号称拥有全球最大图书数据库的公司。它在官网上向AI客户公开兜售纸质书采购服务,宣称一次可以采购1000至100万本书,货源覆盖旧书店、图书馆和绝版书目录。

公司甚至把保密写成了卖点:每个项目都会签署严格的保密协议,客户身份、采购策略和目标书目一概不会披露。

更讽刺的是,ISBNdb自己也知道这门生意见不得光。它在宣传中直接提醒客户:“AI公司毁掉200万本书”,可不是什么能赢得同情的新闻标题。

还有一点很有意思,AI公司最近尤其喜欢2022年以前出版的纸质书。

原因很简单:生成式AI爆发以后,网上混入了大量AI生成内容,还有人故意使用数据投毒工具干扰模型训练。相比之下,2022年以前出版的纸质书几乎可以确定由人类写作,经过编辑、校对和出版流程,也没有被现代投毒工具处理过。

AI公司亲手制造了越来越多的网络垃圾,最后又回头寻找没有被AI污染过的旧书。

这股需求已经传到了二手书市场。一名专营稀有和低流通量图书的书商告诉404 Media,从今年4月开始,他每周处理的订单从20本左右猛增到数百本。被买走的书主题杂乱、语言不同,彼此几乎没有联系,唯一的共同点是都有ISBN编号。

这名书商无法确认买家就是AI公司,但他的库存中有不少外文书、冷门书和绝版书。

他一方面靠这些订单清掉了多年卖不出去的库存,另一方面又很不舒服:“我不喜欢这些书最后的用途,也不喜欢那些不常见的书被打成纸浆。”正如前文所说,AI公司扫描纸质书的流程是很粗暴的,这让生意变好的二手书商也忍不住心疼。

Scroll for more