「切掉书脊,扫完即弃」:AI 的语料胃口烧到了纸质书上

| | 1 次浏览

过去两年,讨论 AI 的外部成本时,我们熟悉的是三本账:电力、水资源和芯片。而影子图书馆 Anna's Archive 最近的一篇博客,补上了第四本——纸张。更准确地说,是那些为喂饱大模型而进入扫描流水线、随后被销毁的实体书。

一场发生在书库里的「资源开采」

这篇题为 AI companies destroy physical books – let's scan rare books before it's too late 的文章,8 月 21 日出现在 Hacker News 上。其核心指控可以概括为一条流水线:

  1. 大模型厂商及其数据供应商需要海量高质量语料,出版书籍是其中信息密度最高的部分之一;
  2. 高速扫描线要求切掉书脊、逐页过机,吞吐量远高于图书馆式的翻页扫描,代价是实体书无法复原;
  3. 扫描完成后,纸书大多直接废弃或回收,其中不乏绝版书与稀有书籍;
  4. 而扫描出的数字副本通常只躺在公司内网里,公众既看不到,也用不上。

文章由此发出一个略显悲壮的呼吁:趁孤本尚未被「开采」殆尽,发动志愿者对稀有书籍做抢救性数字化。在 HN 讨论区,这条帖子收获四十余个赞,评论区里既有附和者,也有人直接追问:证据在哪里?

破坏性扫描:不是新闻,但第一次被这样讲述

「破坏性扫描」(destructive scanning)在数字化行业里并不新鲜。当年 Google Books 扫描数千万册图书时,用的是非破坏性的翻页机器人,速度慢、成本高;而面向 AI 训练的扫描更接近制造业逻辑——把书当作原料,切、扫、弃,追求单位时间的处理量。两种模式背后是两种动机:一个是为了让公众检索,一个是为了让模型消化。

Anna's Archive 描绘的链条则是:图书馆淘汰旧书,旧书批量流入折扣市场,数据供应商整批收购,进扫描线,实体书消失。如果这个描述属实,最讽刺的一点在于:知识以模型权重的形式被永久吸收,而它的物理载体却被系统性抹掉,社会却没有得到任何公共数字副本作为补偿。

当「保存者」本身就是盗版库

这里必须交代背景:Anna's Archive 是长期处于版权灰色地带的影子图书馆,聚合了 Sci-Hub、LibGen 等来源的镜像,在多国遭遇域名查封与访问封锁。由它来喊「抢救孤本」,本身就带着强烈的不协调感。

但这恰恰是过去几年反复上演的剧本。从包含十几万本书的 Books3 语料库,到针对 Meta、Anthropic 的大规模版权诉讼,AI 公司获取图书数据的方式一直争议不断。吊诡之处在于:合法的一方(图书馆、Internet Archive)想做大规模数字化,会被版权法卡住手脚;灰色乃至侵权的一方,反而掌握着最完整的扫描基础设施。这篇文章之所以有传播力,正是因为戳中了这个错位。

难以核实的指控,值得追问的问题

需要指出,文中说法目前难以独立核实:作者匿名,没有披露具体的扫描工厂、供货商或被毁书目清单,HN 评论区也有用户认为其论证依赖供应链传闻。在「AI 公司烧了多少电」都有精确数据的今天,「烧掉了多少本书」反而成了一个黑洞。

但这不妨碍它提出一个值得追问的问题:AI 的物质足迹不止于机房。如果破坏性扫描确实是一种现实商业模式,那么合理的底线要求是——数字副本应当沉淀为公共资源,而不是实体书消失了、数字副本也被锁进私有仓库。图书馆界与档案界长期推动的保存性豁免、面向研究的受限开放,都是比「扫完即弃」体面得多的路径。

点评

无论这篇博客的细节有几分属实,「为训练模型而消耗不可再生的实体文献」这件事本身,都应该在 AI 的成本清单上占一行。数据不是从天上掉下来的,它有时是从书脊上切下来的。真正的问题从来不是谁在扫书,而是扫完之后,谁还能读到。

评论(0)

暂无评论,来写第一条吧。