众力资讯网

简直无法无天!AI公司正在大量购买孤本书籍,然后用机器切开书脊,再高速扫描进电脑

简直无法无天!AI公司正在大量购买孤本书籍,然后用机器切开书脊,再高速扫描进电脑,随后将原版书籍直接销毁!
 
这些书被买回去,不是为了阅读,也不是为了收藏,而是直接送上机器。
 
液压切割机一刀下去,整条书脊被切掉,原本装订完整的书瞬间变成一摞散页。工人再把纸页塞进高速扫描仪,文字传进电脑,扫描完的纸张统一打包,当成废品拉走。
 
科技媒体404 Media调查发现,名为ISBNdb的图书数据服务商,已经开始专门帮AI公司大批量收书。一次订单最少可以采购1000册,最高能够拉到100万册。
 
买家需要什么年代、什么语言、什么专业的书,只要列出清单,平台就能从二手书商、旧书网站和库存渠道里大规模搜罗。
 
至于买家究竟是谁,ISBNdb会用保密协议把身份遮得严严实实,连采购目标和用途都不会对外透露。
 
它们为什么偏偏喜欢2022年以前出版的书?
 
因为这些书足够“干净”。生成式AI大规模普及之后,网上出现了大量机器写出来的文章、评论、广告和问答。AI如果继续拿这些内容训练,就等于用自己说过的话再教自己,错误会被反复放大,文字也会越来越空洞。
 
《自然》杂志发表过相关研究,反复使用机器生成的数据训练新模型,确实可能出现“模型崩塌”。因此,那些在AI浪潮之前出版的实体书,突然成了科技公司眼中的香饽饽。
 
这些文字出自真人,经过作者写作、编辑修改、出版社校对,有些专业著作还要接受同行审查。相比互联网上东拼西凑的内容,旧书里的知识更完整,表达也更扎实。
 
可问题在于,AI公司看上的只是书里的文字,根本不在乎书本身能不能留下。
 
Anthropic就是一个很典型的例子。美国法院公开的材料显示,这家开发Claude的AI公司曾经推进一项“巴拿马计划”,说白了,就是花钱买来海量纸质书,再进行破坏性扫描。
 
一年左右,Anthropic花了数千万美元,买下数百万册实体书,很多订单一口气就是几万本。
 
负责扫描的合作方还做过一份方案,准备在半年内处理50万到200万本书。整个步骤被安排得明明白白:机器切掉书脊,高速扫描纸页,数据存入系统,剩下的书页联系回收公司拉走。
 
这已经不是扫描书了,简直就是一条“吞书流水线”。
 
旧书市场也跟着出现了怪事。一位书商透露,自己平常一个星期大约只能卖出20本书,可从2026年4月开始,每周销量突然涨到几百本。最受欢迎的不是畅销小说,反而是那些冷门书、绝版书、外语书和专业资料。
 
有些买家甚至不怎么还价,只要书名对得上,价格高一点也照样收。
 
这恰恰是最危险的地方。畅销书被毁掉一本,市场上可能还有几十万本。可地方志、早期学术著作、旧技术手册、小语种作品,本来就印得少,有些在旧书市场转了几十年,可能已经找不到第二册。
 
如果AI公司买走的恰好是最后一册,扫描完又把原书粉碎,而电子文件只存在它自己的数据库里,那么这本书就等于从公共世界里消失了。
 
以后普通人想读,图书馆没有;学者想查,网上找不到;作者的后人想核对,也只能去求一家商业公司开门。
 
但人家愿不愿意开,完全是另一回事。
 
在我看来,这才是整件事真正让人愤怒的地方。
 
AI学习人类的知识没有问题,可它不能一边把书吃进肚子里,一边把人类继续阅读这些书的路堵死。机器记住了几段文字,不能叫文化保存;数据库里藏着一份文件,更不能代替一本任何人都有机会接触的实体书。
 
更离谱的是,美国法院还给这套做法留下了法律空间。法院认为,只要企业花钱买下实体书,扫描之后销毁原件,把电子版本留在内部使用,就可能被算作“合理使用”。
 
这不就是给资本指了一条路吗?
 
先把散落在民间的旧书批量买走,再把内容装进私人数据库,最后毁掉原件。这样一来,书里的知识还在,却不再属于公共社会,而是变成了少数AI公司的训练资源和商业筹码。
 
站在中国的角度,这件事绝对不能只当成外国科技圈的热闹。
 
我国还有大量没有数字化的地方文献、行业资料、早期刊物、海外中文著作和民族语言书籍。这些东西平常看着不起眼,真正研究一段历史、一个行业或者一片地区时,却可能是最关键的材料。
 
一旦这些书被匿名大单扫走,想找回来就难了。
 
AI公司真想使用,可以付钱,可以扫描,也可以合作,但至少应该无损处理,并给公共图书馆留下可以查阅的数字副本。
 
技术发展不能靠砍断历史的书脊来完成。
 
资本这一次抢的表面上是旧书,实际上抢的是人类积累了几百年的知识。书被切碎以后,数据又被锁进企业服务器,普通人只能隔着一扇门猜测里面到底装了什么。
 
如果连一本书最后的实体都没有留下,那么所谓的“数字化保存”,很可能只是把公共知识搬进了私人保险柜。
 
机器吃饱了,人类的书架却空了,这才是真正可怕的地方。