📖 训练数据 · 伦理争议

数百万本书被AI"阅后即焚":秘密采购、扫描销毁,冷门书正在永久消失

Anthropic 被曝"巴拿马计划"——一年内花费数千万美元采购数百万本纸质书,切脊扫描后全部销毁。冷门书、绝版书因"无AI污染"成为上上品,而外界无从知晓哪些书已永远消失。

来源:综合公开信息整理 2026-02-18 全文约 4 分钟读完
#训练数据 #Anthropic #纸质书销毁 #版权伦理 #巴拿马计划
数百万本 纸质书被采购并销毁
数千万美元 Anthropic 一年投入
700万+ 盗版电子书曾下载量

⚡ 30 秒速览

  • 巴拿马计划:Anthropic 内部代号,一年内采购数百万本纸质书,切掉书脊、高速扫描、纸张销毁,仅一份方案就计划半年处理 50 万至 200 万本。
  • 法律逻辑:2025 年法官判例认为合法购买并扫描纸质书属"合理使用"——销毁原书反而降低了法律风险,因为市场上没有增加副本数量。
  • 绝版书危机:冷门书、绝版书因"无 AI 污染、无数据投毒"成为首选目标,书商每周订单从 20 本猛增至数百本,无人检查存世册数。
  • 行业退让:马斯克要求 SpaceXAI 无损扫描稀有书籍;ISBNdb 删除公开宣传页面,改口称"只是市场需求测试"。

01巴拿马计划:数百万本书的"阅后即焚"

2024 年 8 月,三名作家将 Anthropic 告上法庭,指控其未经授权使用作品训练 Claude。随着 4000 多页法庭材料陆续解封,一个内部代号为"巴拿马计划"的工程浮出水面。

计划简单而粗暴:大规模购买纸质书,切掉书脊,将散开的书页送进高速扫描仪,再把剩下的纸张交给回收公司。仅一份项目方案,就计划在半年内处理50 万至 200 万本

📦 批量采购 🔪 切掉书脊 📄 高速扫描 ♻️ 纸张销毁 🤖 训练模型

注:流程中的"切掉书脊"是工业化的标准做法,但也是让外界最不适的一步——它意味着实体书被不可逆地破坏。

Anthropic 内部文件中的两句话,让整件事的性质彻底改变:"巴拿马计划,是我们对全世界所有书籍进行破坏性扫描的行动。"以及"我们不希望外界知道我们正在做这件事。"

规模已经足够惊人,但真正让文化界警觉的,是另一个问题。

02法律判例:为什么合法购买、扫描并销毁反而风险更低?

2025 年 6 月,法官威廉·阿尔萨普给出了一套对 Anthropic 相当有利的判断。核心逻辑是:大模型读取一本书,不是为了向用户复述或出售,而是从中学习语言、知识和表达方式——这种用途具有"转化性",可以认为在合理使用范围内。

传统认知

未经授权使用作品训练 AI 就是侵权,不管是通过什么方式获取的。

2025 年判例逻辑

合法买下一本纸质书,扫描成数字文件,再销毁纸质原本——最终只有一份副本,没有增加市场流通量,相当于"格式替换"。

更反直觉的一点是:销毁原书反而成了证明合法的一环。如果原书继续留在市场上,Anthropic 手里又多出一份数字版,便可能涉及未经授权的复制;把纸质书销毁,只保留数字文件,法律风险反而更低。

"Anthropic 放弃盗版书库,转而购买、扫描纸质书,是一个聪明的选择,也体现了更加克制、符合法律的做法。"
—— 康奈尔科技学院数字与信息法教授 James Grimmelmann

注:但教授同时指出,这套逻辑对于冷门书和绝版书来说,存在明显的文化保护漏洞。

法律上站得住脚,不代表文化上可以接受。尤其是当目标变成那些"世上可能只剩几百本"的冷门书时。

03绝版书风险:当最后一册被送入切纸机

2022 年以前出版的纸质书,因为没有混入 AI 生成内容、未经数据投毒工具处理,成了 AI 公司眼中的"上上品"。那些网上搜不到、没有电子版的冷门书和绝版书,更是"上上品中的上上品"。

这股需求已经传到了二手书市场。一名专营稀有和低流通量图书的书商透露,从今年 4 月开始,他每周处理的订单从20 本左右猛增到数百本。被买走的书主题杂乱、语言不同,唯一的共同点是都有 ISBN 编号。

📚 书商的两难 冷门书 · 绝版书

  • 订单激增:每周从 20 本到数百本,清掉了多年卖不出去的库存,但买家身份成谜。
  • 来源复杂:外文书、冷门书、绝版书混杂,书商无法确认是否被用于 AI 训练。
  • 核心担忧:"我不喜欢这些书最后的用途,也不喜欢那些不常见的书被打成纸浆。"
关键问题:没有人检查过这些书在世界上的存世册数。绝版不等于孤本,但风险显而易见。

澳大利亚和新西兰古旧书商协会主席 Dawn Albinger 指出,古旧书的价值并不只在印刷出来的正文——书页上可能有亲历者留下的批注,签名、题赠和历任收藏者的信息可以证明流传经历,重新装订的封皮里甚至可能藏着更早的手稿。这些信息都依附于那一本具体的书。

AI 公司得到了一份适合训练模型的数字文件,却可能毁掉了一件无法通过数字文件完整还原的实物。

04行业退让与未解之问

争议扩大后,科技行业很快出现了退让。马斯克在 X 上表示,已经要求 SpaceXAI 团队将稀有书籍保存在图书馆,并采用更麻烦的无损方式扫描,不能简单切掉书脊。他没有公布买了多少书,也没有定义什么样的书算"稀有"。

ISBNdb 退让得更快。这家曾公开宣称"一次采购 1000 至 100 万本纸质书、通过保密协议藏住买家身份"的公司,在报道发布 9 天后删除了面向 AI 公司的纸质书采购页面,改口称相关页面"只是一次市场需求测试,服务从未真正上线"

但几个网页的删除,代替不了真正的规则。

谁负责在扫描前判断一本书是否稀有?判断依据是出版年份、版本和存世数量,还是书里的签名、批注和装帧?
AI 公司是否应该公开大规模采购的书目?如果某本书已经绝版,是否只能采用无损扫描,并在扫描后交给图书馆保存?
ISBNdb 反复强调 2022 年以前的纸质书"保存了没有受到 AI 污染的人类知识"——AI 公司越承认这些内容不可替代,就越难解释为什么承载它们的实体可以被当成一次性耗材。

注:以上问题目前均无答案。美国法律体系为 AI 训练数据开了口子,但文化保护机制尚未跟上。

编辑核心判断

AI 公司为寻找"纯净数据"而批量销毁纸质书,在技术上可以理解,在文化上却是一条危险的捷径。当冷门书的最后一册被送入切纸机,人类失去的不只是一本书——而是一段无法被数字文件还原的历史。法律允许的,不等于文明该接受的。

这件事与你有关

每一本被切掉书脊的冷门书,都是一次不可逆的文化损失。关注 AI 训练数据的来源,就是关注人类知识遗产的未来。

持续关注 · 综合公开信息整理