众力资讯网

AI 巨头们为了抢干净的训练数据,开始疯抢古董孤本书了!   因为 2022 年

AI 巨头们为了抢干净的训练数据,开始疯抢古董孤本书了!
 
因为 2022 年前的老书没有 AI 垃圾污染,AI 公司通过第三方匿名买断,切掉书脊、高速扫描后直接粉碎销毁!
 
这事刚爆出来的时候,我第一反应是科幻小说照进现实。你敢信吗?全世界最前沿的科技公司,放着海量互联网数据不用,转头去旧货市场淘几十年前的旧书,还得偷偷摸摸通过中间商匿名采购,生怕别人知道是谁在买。
 
那这帮人为什么非要盯着2022年前的书。说穿了就一句话——现在的互联网已经"脏了"。
 
从2022年底ChatGPT爆火开始,AI生成内容就像洪水一样灌满了全网。文案、文章、问答、评论,甚至很多所谓的"原创内容",其实都是机器吐出来的。
 
这些东西再反过来喂给新的AI模型,就形成了一个可怕的循环:AI学AI自己写的东西,越学越跑偏,最后变成互相抄的复读机。
 
业内管这个叫"模型自噬",也有人叫"数据污染"。就像你反复复印同一张纸,复印次数越多,字迹越模糊。AI训练也是一个道理,用含有大量AI生成内容的数据训练下一代模型,只会让模型越来越平庸,逻辑越来越混乱,甚至会编造出根本不存在的事实。
 
所以你看,绕了一大圈,最干净、最纯粹的人类智慧结晶,反而成了AI时代的稀缺品。2022年之前出版的纸质书,尤其是那些冷门的、绝版的、甚至存世量只有几本的孤本,就成了AI巨头眼里的黄金矿藏。这些书里的每一个字都是真人写的,有真实的思考、真实的情绪、真实的时代印记,没有被AI算法污染过半分。
 
很多人问,扫描就扫描,为啥非要把书毁了?我认为这里头有两层原因。
 
第一层最直白,就是效率和成本。一本一本无损扫描,一页一页翻,速度慢、人工贵。切掉书脊用流水线扫,效率能翻几十倍。对于要扫几百万本书的巨头来说,这差的不是一点半点。书才值几个钱?机器和人工才是大头。
 
但第二层原因,就没那么简单了。在我看来,销毁实体书,本质上是在制造数据垄断。你想啊,一本绝版书,全世界可能就剩几十本。AI公司全买下来,扫完直接销毁,那这份数据就成了他们家独有的。别家公司再想拿到同样的训练素材,门都没有。这就相当于把人类的公共文化遗产,悄无声息地转化成了企业的私有资产。
 
更有意思的是,这套操作在美国法院还被判了"合理使用"。法官的逻辑是:书是我合法花钱买的,我买下来之后怎么处理是我的事,我扫描完自己用,不对外传播复制件,那就不算侵权。这话听着好像没毛病,但你仔细品,总觉得哪里不对。
 
我给你举个例子就懂了。你买了一张正版CD,你可以自己听,也可以把它砸了,但你能不能把CD里的歌全部拷出来,用来训练一个能自动写歌的AI,然后靠这个AI赚钱?道理其实是一样的。法律上可能暂时挑不出错,但情理上、文化价值上,这笔账不是这么算的。
 
说到这儿,肯定有人会说,不就是几本旧书吗?数字化保存不是更好吗?纸张还会发霉会着火,存在服务器里永远不会坏。
 
这话我一半同意,一半不同意。数字化本身是好事,但"扫描完就销毁"和"数字化保存"完全是两码事。真正的数字化保护,是扫描完把原书好好存进图书馆、档案馆,让所有人都能看。而现在AI公司干的事,是把书买下来,数据自己揣兜里,原件直接毁掉,这叫哪门子保护?这叫买断然后销毁证据。
 
我认为这件事最值得警惕的地方,根本不是毁了几本书,而是它开启了一个很坏的先例:当AI技术足够强大、资本足够雄厚的时候,人类几千年来积累的公共知识财富,是可以被企业批量买断、私有化的。
 
今天他们买的是旧书,明天呢?会不会去买老报纸、老杂志、老照片?会不会去收购私人信件、口述历史?只要是人类原创的、没被AI污染过的内容,迟早都会被盯上。等到有一天,最优质的人类文化数据,全都攥在几家科技公司手里,那会是什么光景?
 
当然,我也不是全盘否定这件事。站在技术发展的角度,AI需要高质量数据是客观事实,总不能让模型越训练越笨。合法购买、合理使用,从现有法律框架看也站得住脚。但合法不代表就合理,更不代表就没有问题。
 
真正的问题在于,我们的规则、法律、伦理观念,都还没跟上技术的脚步。AI公司在前面一路狂奔,把旧书一本一本送进粉碎机,而我们还在争论"买下来的东西能不能随便毁"这种基础问题。
 
最后我想说一句很扎心的话:AI发展到今天,最值钱的居然不是算法、不是芯片,而是人类在AI出现之前写下的那些文字。我们用最先进的技术,制造了海量的信息垃圾,最后又不得不回头去垃圾堆里淘金。这本身就是一个巨大的讽刺。
 
这件事后续会怎么发展,是会出台新规约束,还是会有更多公司加入"扫书大军",现在还不好说。但可以确定的是,在AI时代,每一个字的人类原创内容,都在变得越来越珍贵。