众力资讯网

美国AI公司偷偷毁书百万册,马斯克紧急发声。 美国人工智能公司Anthropi

美国AI公司偷偷毁书百万册,马斯克紧急发声。

美国人工智能公司Anthropic最近干了一件让人难以置信的事,这家公司从2024年初启动“巴拿马计划”,砸下数千万美元,从全球二手书商那里批量采购纸质书。单笔订单少则一千本,多则上百万本。他们尤其喜欢冷门学术书、绝版教材、地方史料、小语种文献和古籍,因为这些书的内容质量高;而且大多是2022年之前出版的,没有被AI生成内容污染过。

他们为什么要这么做?因为训练大语言模型需要海量高质量文本。

互联网上的公开网页虽然多,但垃圾内容太多,尤其现在生成式AI普及之后,机器写的文章到处都是,质量大幅下降。如果AI反复用这些合成数据训练自己,就会出现“模型塌缩”的后果,简单说就是模型的输出会越来越同质化,最后变得驴唇不对马嘴。

纸质书来自人类原创,经过编辑审校,结构完整、语言精准、知识密集,被视为“干净的知识矿藏”,能有效避免模型退化。

按理说,把书买来扫描数字化,这本身还能接受。但问题出在操作方式上,Anthropic拿到书之后,直接动用液压切割机切断书脊,再用高速扫描仪把散页扫成电子版,然后——这些书页就被粉碎销毁了。很多书本来就印数少,尤其是古籍,毁一本就少一本。

宝贵的学术成果还没来得及广泛传播,就变成了纸屑。更让人不安的是,这家公司走的是闭源路线,数据库不对外开放。这等于把知识集中到自己手里,筑起壁垒,搞知识垄断,长远看肯定会阻碍人类文明发展。

除了毁书,Anthropic还干过另一件事。早在2021年,其联合创始人之一就曾亲自操作,从网上下载了至少五百万本盗版图书,2022年又下载了几百万本。后来作者发现后告上法庭,法院判他们赔偿15亿美元,折合人民币超过100亿元。但讽刺的是,对于毁书的行为,联邦法官威廉·阿尔苏普却认为这属于“合理使用”,目的是“变革性”的大模型训练,所以没有处罚。

法律只是道德的底线,公众没法用底线来要求社会。Anthropic的做法虽然法律上可能逃过一劫,但舆论不会放过。

丑闻曝光后,马斯克紧急在社交媒体上表态,说他已经对自己的AI公司SpaceXAI提出要求,必须以不损坏书籍的方式进行扫描,处理后的数据要保存在图书馆里。但要注意,他说的是“我已要求”,这明显是看到舆论发酵才临时调整的,说明之前SpaceXAI大概率也是用同样粗暴的手段。不过马斯克这个举动至少证明,公众舆论还能给这些巨头施加一些压力。

但直到现在,Anthropic和其他几家公司还没有像马斯克那样做出承诺。谁也不知道他们是不是还在继续毁书。在资本面前,人类文明成果就这么被随意践踏。如果这种观念不被遏制,未来的人类世界会变成什么样,真是不敢想。