AI公司买走绝版古书,扫描完就销毁小盒子的技术分析

8/4/2026

故事是这样的。

澳洲有一家二手书店,老板是个普通得不能再普通的旧书商。最近他收到一批奇怪的订单,全是市面上找不到的绝版老书,还点名只要 2022 年以前出版的。

一次几十本,隔三差五来一单。

老板一开始还挺高兴,大客户啊。后来慢慢觉得不对劲,收货地址写着 Anthropic,就是做 Claude 那家 AI 公司。

这批书的命运,比绝版更惨。

它们不是被收藏,也不是被翻印,而是被送进高速机器,切断书脊,飞速扫完,原件销毁。

买来就是为了毁掉它。

你敢信???

更离谱的是,有位联邦法官裁定,AI 公司这么干,属于「合理使用」。

合法地买书,合法地毁书,合法地喂给模型。

看到这我整个人都不好了,我寻思了一下没寻思明白,一个做 AI 的公司,为什么非要毁掉实体书?书都没了,知识不就没了吗?

后来翻了翻媒体基于法庭解封文件的深度报道,才弄明白。

它们不是讨厌书,它们是怕书不干净。

Anthropic 内部管这个项目叫「巴拿马计划」,Project Panama,思路就一条,只找 2022 年以前出版的书,因为 2022 年之后的内容,可能已经被 AI 污染了。

怎么个污染法?

2022 年后网上多了多少 AI 写的东西?营销文案、自媒体、甚至书稿,混在人类内容里,很难分辨。拿这些「被 AI 碰过」的文本去训练下一代模型,会发生一件很要命的事,模型坍缩。

说人话就是,模型学的是概率,AI 文本喂得越多,学到的就越不是人类表达,而是上一代 AI 的表达,一代传一代,像近亲繁殖,最后只会复读自己。论文管这叫 model collapse,打个不雅观的比方,AI 吃自己的排泄物,越吃越虚。

所以 Anthropic 才要满世界搜罗 2022 年以前的书,那时候 AI 还没学会写字,书里的每个字都是人类写出来的,是「纯净」的人类知识样本。绝版的书没被数字化浪潮反复咀嚼过,最干净。

这也是为什么它们连 400 年前的宗教裁判所文件都不放过,那些记录中世纪审判异端的手稿,差点变成纸浆,就为了几页「纯净」文本。

几百年前的人写下的字,变成了喂给 AI 的饲料。

但问题又来了,买书就买书,为什么要毁掉?好好存着,扫描件不一样到手了吗?

这里面的门道,是法律团队精心设计出来的。

联邦法官 Alsup 在 Bartz v. Anthropic (Bartz v. Anthropic 是一起具有里程碑意义的 AI 版权集体诉讼案)里给的逻辑是,买了实体书再销毁,只留数字副本,这叫「一对一格式转换」,合理使用。如果书也留着、扫描件也留着,性质就变了,那叫「复制」不叫「转换」,版权风险拉满。

所以销毁不是蔑视知识,恰恰相反,是律师们算计出来的合规路径。

只有把原件毁掉,你手里的数字副本才站得住脚。

这才是整件事最细思极恐的地方,法律允许你买了书、毁了书、把知识喂给机器,全程合法,一点毛病没有。

来看看这些书是怎么销毁的吧。液压切割机切掉书脊,书变成一页页散纸,扫描仪唰唰扫完,剩下的纸和水、化学品搅成纸浆,做成卫生纸、包装纸。出版业每年都这么处理滞销书,光法国一年 1.4 亿册,Anthropic 用的是同一套工业流程。

历史上不止一次有人烧过书,每一次都被钉在耻辱柱上。可这一次,没有人举火把,没有人喊口号,只有「合理使用」四个字,文明地、合法地、批量地把书变成数据。

我很难说这到底是好是坏,追求纯净数据源确实有道理。但作为爱书的人,看着一箱箱绝版书变成纸浆,心里还是很难受。

人类几千年的知识,第一次不是被收藏,而是被当作饲料喂给 AI。

更让我觉得后怕的是,2022 年这条分界线划下去,以后所有新出版的书,理论上都可能「不够纯净」了。AI 公司要训练下一代模型,只能去更古老的纸堆里翻。

我们正在亲手把自己变成化石。

也许很多年后,AI 会写出一本完美的书,没有任何人类能写出那样的文字。而它的素材,来自 2022 年以前,那些被撕碎、被扫描、被销毁的人类手稿。那时候大概没人记得,这些书曾经放在某个二手书店的架子上,等待一个真正会翻开它的人。

Scroll for more