硅谷掀起百万书籍切割风波,人工智能训练数据争议升级,纸质知识被扫描后销毁引发全球讨论,谁来守护人类文明留下的原始记忆,科技发展与知识保护之间的矛盾正在浮出水面
一场围绕人工智能训练数据的争议,在硅谷引发巨大关注。有媒体披露,一些人工智能企业为了获取高质量文字数据,大量采购纸质书籍,将书页切割后进行扫描,完成数字化处理后销毁原书,这种做法被不少网友称为“数字时代的毁书事件”。
相关话题在社交平台传播后,引发大量讨论。很多人认为,书籍不仅是文字载体,也是人类知识保存的重要方式,一旦纸质原版消失,一些小众和绝版作品可能再也无法找到完整来源。
受到关注的企业包括人工智能公司 Anthropic。公开信息显示,该公司曾投入资金购买大量书籍,希望获取高质量文本用于模型训练。工作人员通过设备逐页扫描书籍,将内容转化为数字数据,部分完成处理后的纸质书被直接废弃。
支持者认为,这种方式可以提高数据处理效率,也能帮助人工智能系统学习更多人类文字表达。随着公开网络数据不断被使用,企业希望寻找质量更高、来源更稳定的内容作为训练材料,纸质书籍因此成为重要选择。
但争议也随之出现。很多人担心,纸质书和数字文件并不完全相同。一本书可以被保存、流通、转交给不同的人,经过多年时间依然可能发挥价值,而被转换后的数字版本通常掌握在企业内部,普通公众难以接触。
围绕版权问题,美国法院曾审理相关案件,并认定部分书籍数字化处理行为符合合理使用原则。法院认为,将纸质内容转换为内部数字副本,并没有产生新的公开传播版本,在版权范围内存在一定合法空间。
不过,法律层面的认可并没有消除社会争议。有人指出,一些绝版书籍本身缺少电子备份,如果纸质原件被销毁,可能意味着这些文字资料从现实世界中消失,未来研究者或普通读者都可能失去查找原始内容的机会。
这场争论背后,真正受到关注的是科技发展与知识保存之间的平衡。人工智能需要大量数据进行训练,但人类社会也需要保留能够验证信息来源的原始资料。
如果未来越来越多知识只存在于少数企业掌握的数据库中,人们面对人工智能生成内容时,可能缺少足够的原始文本进行核对。保存书籍、保护历史资料,并不是阻碍科技进步,而是在科技发展的过程中留下可靠依据。
人工智能正在改变信息生产方式,但人类积累多年的文化记录仍需要被妥善保存。如何让技术创新与知识传承保持平衡,成为摆在社会面前的重要问题。
