YC科技资讯网

第一次听到这个事,整个人都麻了!AI公司正在大量购买孤本书籍,然后用机器切开书脊

第一次听到这个事,整个人都麻了!AI公司正在大量购买孤本书籍,然后用机器切开书脊,再高速扫描进电脑,随后将原版书籍直接销毁!

据报道,一项名为ISBNdb的服务促成了多达一百万本书的订单,并为买家保持匿名,这100多万本书就这样消失了!大家都在猜这个匿名的客户是谁,有网友指向是Anthropic!

为什么AI公司突然盯上了纸质书?

原因并不复杂。大模型训练需要海量文字,可互联网上如今充斥着AI生成内容,机器再拿这些内容训练自己,数据质量可能越来越差。于是,2022年以前出版的书籍成了抢手资源,因为这些文本大多由人类完成,受到AI内容污染的可能性较低。

说白了,AI公司想要的是更干净、更稳定的训练材料。

ISBNdb原本主要做图书编目和数据库服务,后来开始帮助客户批量采购二手书。它提供的不只是找书,还包括保密流程,客户可以不公开身份,整批购买符合条件的书籍。

什么书最容易进入采购清单?带有ISBN编号,出版时间较早,价格不高,题材不限。书商反映,过去每周卖出20本已经算不错,后来订单突然增加到几百本,买家几乎不挑内容。

买来的书又是怎么进入AI数据库的?

操作过程非常直接。先用液压设备切掉书脊,把整本书拆成一张张散页,再送进工业扫描仪。机器高速翻页,文字被转换成电子文件,扫描完成后,实体书直接销毁。

买一本,切一本,扫一本,毁一本。

为什么不采用无损扫描?因为切开书脊虽然残酷,却更快,成本也更低。对追求效率的商业公司来说,一本书能不能继续保存,可能比不上扫描速度和数据规模重要。

据法庭文件显示,Anthropic曾在这一过程中销毁约200万本实体书。公司内部把相关项目称为巴拿马计划,目标被描述为破坏性扫描世界上的所有书籍。

为了推进这项业务,Anthropic还聘请了前谷歌图书合作业务负责人。这个动作也让外界联想到谷歌早年推动大规模图书数字化的经验,只是这一次,书籍被扫描之后,原件可能不再留下。

最具争议的地方,是美国法院对这种做法的判断。

2025年6月,美国联邦法院在Anthropic版权案件中认定,合法购买纸质书,再进行破坏性扫描并用于AI训练,属于版权法允许的合理使用。法官的解释是,公司合法拥有纸质书,扫描后又把原书销毁,同一时间只保留一份数字副本,没有额外增加副本,也没有对外分发。

这意味着什么?买书、扫描、销毁这条路径,可能不需要逐一获得作者或出版社授权。

不过,同一案件还有另一部分结论。Anthropic曾从盗版网站下载约700万本电子书,这一行为被法院认定侵权,最终以15亿美元和解。纸质书合法购买后销毁,和直接下载盗版电子书,在法律上成了两条完全不同的路。

法律上说得通,现实里却留下了更大的疑问。

如果一本18世纪植物学著作只剩几册,如果一本地方志从未重新出版,如果一本冷门学术专著全世界只剩少量存本,谁来决定它们可以被切开?谁又能保证,进入AI公司私人数据库的电子版,未来会向公众开放?

更麻烦的是,纸质原件一旦被毁,数字文件又掌握在少数公司手里,普通人可能既看不到原书,也无法访问扫描版本。一本书原本属于公共文化记忆,最后却可能只剩下一家公司服务器里的训练材料。

有人认为,这些旧书放在二手市场,没人购买也可能发霉、损坏,卖给AI公司至少完成了数字化保存。问题在于,扫描者保存的是数据,不一定保存文化本身。书页上的装帧、批注、印刷差异、流传痕迹,也可能随着书脊被切断一起消失。

马斯克看到相关报道后,要求团队采用无损扫描,尽量保留珍稀书籍原件。速度或许慢一些,成本也可能更高,但至少不会让扫描成为书籍的最后一次呼吸。

信息来源:经济时报 2026-07-30 19:34 AI 对数据的渴求正在吞噬珍本图书,书商借此获利