新时代的「焚书运动」开始了吗?
7 月 28 日,调查媒体 404 Media 曝光了一件事:多家头部 AI 公司正在通过中间商大规模收购旧书,扫描提取内容训练模型,然后把书销毁。
往前翻一下,这个操作最早可以追溯到 Anthropic 的「巴拿马计划」。2025 年 6 月,美国北加州联邦地方法院法官 William Alsup 做了一项裁定:合法购买图书、破坏性扫描、销毁纸本、内部用于 AI 训练,属于版权法中的「合理使用」。Anthropic 此前因为从盗版电子书网站 LibGen 下载数百万册书籍,被判了 15 亿美元和解金。法院判决出来之后,它干脆转向实体书这条路。合法买,合法切,合法销毁。
操作流程是工业化的。液压切刀切开书脊,高速工业扫描仪整本扫入,纸浆回收,原书不再存在。Anthropic 内部规划文件里有一句原话:「巴拿马计划是我们试图以破坏性的方式扫描全世界所有书籍的行动。我们不想让别人知道我们正在进行这项计划。」首轮销毁近 50 万册,累计接近 200 万册。
AI 公司愿意花这个钱,根因在「模型坍缩」。2022 年之后,AI 生成的低质量内容大量涌入互联网。用这些内容训练下一代模型,误差逐代累积,输出越来越空洞,越来越像样板。2022 年之前出版的纸质书成了仅剩的「干净数据源」:纯人类原创、经过编辑校对、无 AI 套路感。
采购规模在 2026 年 4 月之后突然激增。匿名中间商从每周卖 20 册飙到数百册。加拿大旧书商 Zoombooks 每天固定时间自动下单,只买 1970 年代后出版的非虚构类书。ISBNdb 这个拥有 1.11 亿册书籍编目的在线数据库,已经把业务转向为 AI 公司提供批量购书服务。买家完全不看价格,来者不拒。
电波关心的倒不是 Anthropic 又花了几百万美金买书。这件事的增量在另一个地方。
过去十年,AI 对数据的依赖经历了两段。第一段是爬取开放互联网,网页、论坛、社交媒体、维基百科。那时候数据是公共的,谁都能抓。第二段是现在:互联网被 AI 生成内容污染了,AI 公司开始进入物理世界,寻找还没有被 AI 碰过的「干净」文字。旧书、绝版书、冷门古籍、地方文献,这些存在了几十年的人类书写,正在被一车一车送进高速扫描仪,然后被销毁。
法院认定这是「合理使用」,理由是 AI 公司购买实体书后做的是一对一格式转换,不对外散布,目的是「创造出不同的东西」而非复制原书。但这个逻辑背后有一个法院没有回答的问题:扫描后的内容进入了 AI 公司的私人数据库,公众再也无法读到这些被销毁的书。公共文化资源变成了少数公司的私有训练资产。
马斯克在 X 上回应这件事时说了另一条路:SpaceX 的 AI 团队会保存珍贵书籍,用无损扫描。不管这个姿态有多少兑现空间,至少说明行业里有人意识到「先切书脊、再扫、再销毁」这个操作踩到了一根文化底线。
这件事还没结束。出版商已经起诉 Google,称其使用数百万本受版权保护的书籍训练 Gemini,是「历史上最严重的侵犯版权行为之一」,内部文件估算潜在罚款在 100 亿到 1000 亿美元之间。新闻集团起诉 Brave Software 未经授权抓取转售文章内容。这些官司的结果会直接影响整条赛道还能不能继续买书、切书、销毁。
有一个细节最让电波不舒服。Anthropic 内部文件里的那句话不是技术文档,不是法律备忘录,而是对团队的命令:「我们不想让别人知道我们正在进行这项计划。」一家公司把销毁 200 万本书当秘密来守,这不只是数据策略问题了。
AI公司被曝大量收购旧书 AI焚书 AI公司为训练模型销毁原版书籍

