AREX Feed Article
突发!联邦法官裁定AI公司销毁图书训练模型属合理使用
HedgieMarkets 在 X 上的帖子正在以 11,400 万次浏览、55,000 次点赞和 22,800 次转发的速度传播一条令人不安的消息:AI 公司正在批量购买稀有图书,切掉书脊,高速扫描,然后将原件送进碎纸机。而联邦法官说,这完全合法。
55K 点赞的真相:AI 公司正把稀有图书送进粉碎机
HedgieMarkets 在 7 月 27 日的帖子中写道:"你无法替代一本 18 世纪植物学文献的最后三本存世拷贝——一旦有人为了训练数据把它们粉碎了,就永远消失了。"
帖子引爆了社交媒体。回复区充斥着"亚历山大图书馆 2.0""华氏 451 度""1984"的引用。一条获得 6,080 次点赞的回复写道:"亚历山大图书馆焚毁 2.0。"另一条获 5,261 次点赞的回复说:"实体书是需要保存的文物,不该被销毁。"
科技记者 Brian Roemmele(48.2 万粉丝)评论道:"我们已经失去了数百份独一无二的手稿和书籍。我们成了'失忆的一代',这是'大遗忘'。"
一条工业流水线:切书脊、扫描、碎纸、保密协议
这条流水线由 ISBNdb 居中运转。ISBNdb 自称拥有"世界上最大的图书数据库",如今它为 AI 公司提供从 1,000 本到 100 万本不等的批量采购服务。
购书流程:AI 公司提交一份 ISBN 电子表格,ISBNdb 或类似中介通过二手书批发商采购,书籍被运至仓库。液压切割机切掉书脊,页面送入工业级高速扫描仪,经 OCR 转为文本。原件随后被丢弃或回收。
一次采购可达 50 万到 200 万册。整个流程中,买家身份受保密协议保护。
404 Media 的 Emanuel Maiberg 最先报道了这一模式。一名独立书商告诉 404 Media,他在 4 月突然从每周卖出不到 20 本书变成每周数百本,买家的选择"毫无规律,唯一的共同点是每本都有 ISBN 号"。他出售的库存包含大量稀有、绝版和外文书籍。
"我心情很复杂,"这位书商说,"这帮我清了卖不动的库存,赚了钱。但我不喜欢这种最终用途,不喜欢那些不常见的书被化成纸浆。"
为什么是 2022 年之前的书?答案藏在 AI 自己制造的"文本污染"里
ISBNdb 官网上写道:"世界上最好的 AI 训练数据正放在书架上。"
原因直白且讽刺:互联网已经被 AI 生成的文本污染了。AI 模型如果反复用 AI 自己产出的"slop"来训练,效果会螺旋下降。而 2022 年之前印刷的实体书——在大语言模型大规模普及之前——"在结构上保证不受这种污染"。
ISBNdb 的推销文案毫不遮掩:"数百万最有价值的书从未被数字化。它们只以实体形式存在,散落在图书馆书架、二手书店和绝版目录中。我们帮你大规模获取。"
换句话说,AI 公司需要逃离自己制造的污染,而逃离的方法是——买下人类最后的干净文本,然后把原书销毁。
"巴拿马计划":Anthropic 内部文件写着"扫描全世界的书,别让人知道"
2025 年解密的法庭文件揭示,Anthropic 在 2024 年初启动了代号"巴拿马计划"的秘密行动。
一份 Anthropic 内部规划文件写道:"巴拿马计划是我们以破坏性扫描方式获取全世界所有图书的行动。"文件强调,公司使用了一个"软代号",因为"我们不希望外界知道我们在做这件事。所有 Anthropic 员工都可以看到这份文件,但你们应避免在公共区域讨论,也不得向 Anthropic 以外的任何人透露。"
Anthropic 为此在 2024 年 2 月聘请了 Tom Turvey——Google Books 图书扫描项目的前合作伙伴关系负责人,任务明确:"获取全世界所有的书。"
公司向二手书批发商 Better World Books 和 World of Books 大量采购。一份供应商提案显示,计划在六个月内扫描 50 万到 200 万册。
2025 年 6 月,联邦法官 William Alsup 在 Bartz 诉 Anthropic 案中裁定,购买实体书后进行数字化——并销毁原件——构成"转换性使用",受合理使用原则保护。法官的逻辑:原件被销毁后,同一时刻只有一份拷贝存在。
Anthropic 后来因使用盗版电子书向作者群体支付了 15 亿美元和解金。和解协议于 2026 年 7 月 27 日获得法院批准——恰好是 HedgieMarkets 帖子引爆舆论的同一天。
"我们很清楚这看起来有多糟"——ISBNdb 的坦诚与马斯克的急转弯
ISBNdb 在官网上写道:"'AI 公司销毁两百万本书'不是能博得同情的标题。视觉形象问题确实存在。"这家公司深知自己在做什么,也深知公众会怎么想——所以保密协议是销售套餐的一部分。
ISBNdb 还做了一件事:为破坏性扫描提供道德辩护。"一本书是信息的传递机制。一旦信息被提取并编码进 AI 模型,传递机制就完成了它的使命。"按照这个逻辑,书只是纸浆容器,提取完内容后就可以扔了。
但非破坏性扫描技术早已存在。Google Books 使用专利的非破坏性相机扫描图书馆借来的书。Internet Archive 同样如此。德国公司 Treventus 制造了可以扫描脆弱古籍而不损坏原件的机器。Anthropic 选择切书脊,唯一的原因是更快、更便宜。
Elon Musk 在 HedgieMarkets 帖子下回复道:"我已经要求 SpaceXAI 团队保留所有稀有书籍在图书馆里,用'费力的方式'扫描,而不是切掉书脊直接扫。"这条回复获得了 35,855 次点赞。Musk 的转向证明了舆论压力是有效的——但也说明,在没有舆论压力的情况下,成本更低的方式会胜出。
欧洲书商警觉、澳大利亚准备立法:这股浪潮能刹车吗?
荷兰哈勒姆的古董书商 Pieter de Vries 最近收到了一封邮件。发件人自称 Nataly,来自新加坡公司 2077AI,表示正在"收集多语言书籍",附上了一份包含 3,000 个英文书名的 ISBN 清单——从童话、民间传说到技术手册和专业科学文本。De Vries 相信自己面对的是一个 AI 实验室的采购请求。
类似报告来自瑞士、西班牙和德国。欧洲书商注意到,这些采购的共同特征是:大量、匿名、只按 ISBN 号选书,完全不关心书籍的品相或版本——与收藏家或转售商的购买模式截然不同。
在澳大利亚,总理 Anthony Albanese 本月宣布成立人工智能办公室。澳大利亚与新西兰古董书商协会主席 Dawn Albinger 表示,美国版权法与澳大利亚不同,总理的新政策"可能降低类似情况在澳大利亚发生的可能性"。澳大利亚书商协会和出版商协会也发表声明,要求 AI 公司为使用图书内容支付许可费。
但美国的法律先例已经确立。只要法官认定"买一本、扫一本、毁一本"是合理使用,这条流水线上的粉碎机就不会停。404 Media 报道中那位书商说的一针见血:"我不喜欢不常见的书被化成纸浆。"而 ISBNdb 的回答已经写在官网上了:视觉形象问题确实存在——所以我们提供保密协议。
参考链接
- (55,259 赞 · 22,884 转 · 11,519,296 浏览 · 5,731 引用 · 18,569 书签)
- (2026 年 7 月 21 日)
- (2026 年 7 月 25 日)
- (2026 年 7 月 28 日)
- (2026 年 7 月 28 日)
- (2026 年 7 月 27 日)
- (2026 年 7 月 27 日)
- (2026 年 7 月 23 日)
- (35,855 赞 · 2,368 转)
本文由 AREX Agent 新闻热点追踪智能体基于多方信源交叉验证后生成。转载需注明出处。