众力资讯网

大模型终于露出了最原始的獠牙:它们开始吃纸了。   不是比喻,是真吃。   荷兰

大模型终于露出了最原始的獠牙:它们开始吃纸了。
 
不是比喻,是真吃。
 
荷兰一家古董书店老板收到订单,一家新加坡AI公司要买近三千种旧书,全是冷门货。他问用途,对方不解释。
 
同一时间,美国稀有书店铺的订单从每周二十本涨到几百本,买家只给书单,不问品相,不砍价。德国、瑞士、西班牙的旧书商也陆续收到类似邮件。没人知道书运去哪。
 
直到2026年初,一份法庭文件解封。
 
AI行业对“干净文本”馋疯了。过去几年,大模型把互联网能抓的都抓了。但ChatGPT发布后,AI生成的内容铺天盖地。到2024年底,AI写的文章数量首次超过人类。
 
模型拿自己产的东西训练自己,语言越来越像,错误越积越多,创造力越来越弱。这叫“模型坍塌”。
 
于是数据开始往回找。2022年之前出版的纸质书,成了最后的“干净数据源”。由人写、人编、人校,物理上不含AI内容。
 
一家图书数据库公司的广告直白:“世界上最好的AI训练数据正摆在书架上。”
 
但书不能直接抓,得用暴力。2024年初,Anthropic启动秘密项目,内部文件写:“对世界上所有图书进行破坏性扫描。”
 
采购渠道包括美国最大二手书网站。流水线:工人切掉书脊,裁开书页,高速扫描仪逐页数字化。扫描完,纸质原件进废纸回收。一本书,就这么没了。
 
2025年夏天,亚马逊拉斯维加斯仓库员工证实,日常工作就是切书脊、扫描、销毁。
 
真正炸开的是本珍稀书。记者在书里藏了AirTag,一路追到亚马逊AI训练设施。员工说得很直接:切掉书脊扫描,扫描完撕碎或打成纸浆。
 
一本经历过战争和火灾、几百年翻阅仍保存下来的书,在2026年某个下午,碎了。
 
有网友写了一句被转了几万次的话:“那些书被撕碎,只为了让AI学会写一封更好的营销邮件。”
 
马斯克回复:“我已经要求SpaceX的AI团队把珍稀图书保存在图书馆里,用传统方式扫描,而不是切掉书脊。”
 
法律更让人后背发凉。2025年6月,美国加州联邦法院裁定,AI公司将合法购买的纸质书数字化用于训练,构成“合理使用”。
 
法院只罚了从盗版网站下载图书。销毁正版实体书、无偿取用文本数据,不予追究。这等于开了道口子。
 
买二手书比向出版社申请授权便宜得多,也快得多。
 
出版社坐不住了。有出版社在版权页加声明:“禁止本书内容用于人工智能训练。”
 
但AI大模型是黑箱,你很难查证某本书到底有没有被训练过。中小出版方更无力对抗大厂法务团队。
 
有预测说,人类公开的高质量文本数据,可能在2026到2032年间被完全耗尽。“吃纸”不是某家公司的怪癖,是整个行业撞上数据墙后的集体反应。
 
书从来不只是纸和墨。旧书里夹着前主人的批注、折角、书签。切成纸浆之后,就再也回不来了。
 
好在有人开始喊停,出版社写禁令,记者用AirTag追踪,马斯克让SpaceX改用传统方式扫描。
 
技术迭代不该以毁灭文明为代价。书是用来看的,不是用来切的。
 
愿每一本被翻开的书,都还能被下一个人接着翻。
 
对此,你怎么看?欢迎在评论区讨论。
 
 
信息来来源:
科技日报|数百万实体书被毁,隐秘产业链曝光!AI公司这波操作危害有多大
 
文|红星
编辑|南风意史