第一次听到这个事,整个人都麻了!AI 公司正在大量购买孤本书籍,然后用机器切开书脊,再高速扫描进电脑,随后将原版书籍直接销毁!据报道,一项名为 ISBNdb 的服务促成了多达一百万本书的订单,并为买家保持匿名,这 100 多万本书就这样消失了!大家都在猜这个匿名的客户是谁,有网友指向是 Anthropic!
你可能会问,好好的书,买来看不行吗?为什么非要切了扫,扫了毁?这事说穿了,就是 AI 行业在抢最后一块干净的数据地盘,现在网上到处都是 AI 生成的文字,机器写的东西再拿去训练机器,就像用自己的口水解渴,越喝越渴,业内叫 "模型坍塌"。
所以 2022 年之前出版的纸质书就成了香饽饽 —— 那时候 ChatGPT 还没火,网上还没那么多机器水军文,纸书上的字全是真人一个一个敲出来的,纯得很。
在我看来,这哪里是在买书,分明是在给大模型 "找奶粉",而且还是专挑没有添加剂的有机奶粉,但最让人不舒服的不是扫书,是毁书,你说你扫就扫吧,扫完把书捐给图书馆不行吗?送人不行吗?为什么非要粉碎?这里面的门道深了。
2025 年 6 月,美国加州北区联邦法院法官 William Alsup 在 Bartz 诉 Anthropic 一案里说了一句话,直接把这个事的法律逻辑给挑明了,法官说,你花钱买一本正版纸书,把它切成数字版,然后把纸本销毁,这叫 "一对一转换",副本数量没增加,属于 "合理使用"。
听懂了吗?书毁了,反而合法了,留着,反而可能有版权风险,我的判断是,这根本不是什么技术需要,这是一套精心设计的法律规避操作 —— 毁书不是目的,毁书是为了让 "扫书" 这件事在法庭上站得住脚。
你可能觉得,不就是些旧书吗,扫成电子版不是更方便传播?这话乍一听有道理,但你仔细琢磨就不对了,公共图书馆数字化,是把书扫了放到网上,谁都能看,AI 公司数字化,是把书扫了塞进自家模型里,电子版只有他们能用,原书还没了,知识被数字化了,却没有被公共化;知识开放给了模型,却没有开放给读者。
这是两码事,我认为,这件事最值得警惕的地方就在这里 —— 人类积累了几百年的印刷文明,正在被几家私营公司以 "训练 AI" 的名义,批量转化成它们独有的商业资产,说到 Anthropic,可能有人不太熟,但它家的产品 Claude 你大概率听过。
这家公司搞了个内部项目叫 "巴拿马计划",2024 年初启动的,目标很明确,就是大规模收购全球二手书,他们还专门挖来了前谷歌图书的负责人,野心明摆着 —— 要把全世界的书都收进自家数据库。
谷歌图书当年想做的事,因为版权问题磕磕绊绊做了十几年没做成,Anthropic 换了个思路,直接买、直接切、直接毁,反而在法律上站住了脚,你说这事上哪说理去?而且这事还不是 Anthropic 一家在干。
从德国到西班牙,从澳大利亚到新西兰,旧书商们都发现了同样的怪事 —— 每天固定时间,系统自动跳出订单,专买那些积灰多年没人看的普通旧书,烹饪书、民间故事、冷门游记,来者不拒。
下单的公司叫 Zoombooks,一家加拿大公司,订单稳定得像程序设定的一样,澎湃新闻去年就报道过欧洲旧书市场的这个现象,当时大家还在猜这些书到底去了哪,现在回头看,答案已经很清楚了。
当然,也有人不认同这种做法,马斯克就公开反对毁书扫描,要求自己的团队扫描后必须保留原书,同样是搞 AI,格局差距一下就出来了,你可能会说,马斯克不也是为了训练模型吗?是,但至少人家没把书毁了,书这个东西,它不只是信息的载体,它本身就是一种文化存在。
以前秦始皇焚书还得派人挨家挨户搜,现在倒好,花钱买就行,合法合规,光明正大,有人可能会说,人家花钱买的书,想怎么处理怎么处理,关你什么事?这话从法律上讲没毛病,但从文明的角度讲,毛病大了。
书籍这种东西,它的价值从来不只属于买家,一本写于五十年前的书,承载的是那个时代的思想、知识和记忆,它本质上是人类共同的文化遗产,你花钱买的是纸,不是知识本身,现在你把纸买走了,把知识扒下来装进自家模型,再把纸毁了,这叫什么?这叫合法地买断人类文化遗产的访问权。
15 亿美元,这是 Anthropic 最终为盗版书部分支付的和解金,注意,只是盗版那部分,合法买书扫描销毁的部分,法院认定没问题,15 亿美元听着很多,但对于一家估值几百亿的 AI 公司来说,不过是买路钱。
而普通人呢?以后想查个资料,可能得先问 AI,AI 说有就有,AI 说没有就没有,因为原文早就被切成纸浆了。
你说这是进步还是倒退?我答不上来,但我知道一件事:当所有的书都只存在于某几家公司的服务器里,当所有知识都要经过 AI 的过滤才能到达你面前的时候,我们失去的可能远比得到的要多。



