图片

电影《华氏451》剧照。


美国科技媒体404 Media近日爆料,他们追踪了一本“怀疑会被AI公司买去作为训练数据”的珍稀图书,并一路追查它在美国各地的流转过程。调查显示这本珍贵图书经过多次转运,最后到达了位于美国拉斯维加斯的亚马逊公司仓库。在仓库工作的亚马逊员工表示,他们的工作就是接收大量的印刷图书。这些书会被送进高速扫描机器,机器会先切掉书脊扫描,在扫描结束后将原书撕碎或打成纸浆。在这个过程中,一本实体图书也就被彻底销毁了。


而据英国《每日电讯报》的报道,一位荷兰古籍书商表示曾收到一家名为“2077AI”的公司员工的邮件,对方提供了一份约3000种二手图书的清单,并表示计划进行大规模采购。受访书商表示他最初以为是诈骗,因为在珍贵图书交易中,人们很少会一次购买超过一本书,“所以如果有人过来告诉你,‘我想买你这里几百本书’,这实在太奇怪了。”


据《每日电讯报》报道,今年以来,全球已有数百名珍稀图书商受到类似公司的联系。另据404 Media报道,一项名为“ISBNdb”的互联网服务甚至可以让顾客一次性订购多达100万本实体书,其中包括那些几乎已经没有存世副本的珍稀图书。“ISBNdb”的一名发言人向《每日电讯报》承认,他们确实提供过这项服务,但称那只是一次性的测试,目的是探索市场对于某项服务的需求,而这项服务最终从未真正推出过。


事件曝光引发了大量的网络舆论,有评论就指出:“那些经历过战争、火灾和数百年翻阅仍保存下来的书,如今却被撕碎,只为了让AI学会写一封更好的营销邮件。”甚至连科技公司自己都亲自下场表态,埃隆·马斯克在该网友评论下方回复:“我已经要求SpaceX的AI团队把任何珍稀图书保存在图书馆里,并采用传统方式扫描,而不是简单地切掉书脊后进行扫描。”


有专业人士指出,如今的科技公司对这些过去出版的图书拥有极高的需求。随着互联网中AI生成的内容越来越多,AI模型开发者正在面临所谓的“数据墙”,AI训练仍然需要更多由人类创作的原生内容。而据404 Media报道,如果书籍在2022年以前出版,这些文本通常不会包含AI生成内容,这就可以避免AI模型训练过程中因反复使用AI生成文本而产生的“模型坍缩”问题。


那么,科技公司为什么要对二手图书进行“破坏性扫描”呢?


《每日电讯报》指出,除了提高扫描效率以外,一些科技公司也是为了规避法律风险。美国加州联邦法院此前的一项裁定表示,通过数字扫描获取图书内容并随后销毁实体书,并不构成版权侵权,因为数字版本“替代”了实体版本,这一行为被视为转换而非复制。


这项裁决可能改变了科技公司获取训练数据的成本计算。对科技公司来说,与出版社逐一协商进行授权相比,购买二手书或无人需要的库存可能更有经济性。《每日电讯报》援引科技公司Anthropic的一份内部文件称,该公司曾定下“获取全世界所有的书”的目标。该公司在2024年聘用了曾负责Google Books图书扫描项目的前职员来负责推动这个项目,并要求该项目以尽可能少的“法律、实践和商业上的烦琐程序”来获取旧书。


参考资料:

1.We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility

https://www.404media.co/we-tracked-a-shipment-of-rare-books-it-ended-at-an-amazon-ai-training-facility

2.Cultural barbarism: How AI companies are destroying the world’s books

https://www.telegraph.co.uk/news/2026/07/30/why-ai-companies-are-destroying-millions-of-old-books

3.Now Amazon is destroying rare books to train its AI

https://lithub.com/now-amazon-is-destroying-rare-books-to-train-its-ai


编译/李永博

编辑/罗东

校对/柳宝庆