众力资讯网

硅谷AI拆书练模型,大量纸质书被处理,法院为何认定合理

AI训练数据争议围绕人工智能训练数据来源的问题持续引发讨论,其中一些AI企业获取书籍资源用于模型训练的方式,也成为外界关

AI训练数据争议

围绕人工智能训练数据来源的问题持续引发讨论,其中一些AI企业获取书籍资源用于模型训练的方式,也成为外界关注的焦点。

公开资料显示,Anthropic曾购买大量纸质书籍,并通过拆除装订、扫描页面的方式,将纸质内容转换为数字数据,用于内部研究和人工智能模型训练。

这一做法引发争议的原因在于,部分纸质书籍经过扫描后被处理掉,外界担忧一些小众出版物和难以获取的书籍可能因此减少实体保存数量。

Anthropic相关案件显示,该公司曾投入大量资金购买书籍资源,法院文件披露其采购规模达到数百万册级别,但具体金额和全部采购细节并未完全公开。

在人工智能快速发展的背景下,高质量训练数据的重要性不断提升,出版物中的文字内容因经过人工编辑和长期积累,被认为具有较高的数据价值。

一些业内人士认为,随着公开网络数据逐渐被大量使用,AI企业需要寻找更多高质量数据来源,而书籍成为重要选择之一。

但如何处理这些知识载体,也成为新的社会问题,尤其是在数字化保存和传统纸质保存之间,仍然存在不同观点。

法院认定部分使用方式合理

2025年,美国加州北区联邦地区法院法官威廉·阿尔萨普审理了涉及Anthropic与作者版权争议的案件,并对部分使用行为作出裁定。

法院认为,Anthropic合法购买纸质书籍,并将其转换为数字形式用于训练人工智能模型的行为,在特定情况下可以属于美国版权法中的合理使用范围。

不过,法院并没有认定所有AI训练行为都不存在版权问题,而是区分了合法购买书籍与未经授权获取盗版资料之间的区别。

这一判决意味着,AI企业利用合法来源获得的数据进行研究,可能受到合理使用原则保护,但版权边界仍然需要进一步明确。

目前,围绕人工智能训练数据的争议,并不仅限于书籍是否被销毁,而是涉及版权、知识保存、数据来源以及技术发展的长期影响。

纸质书籍作为人类知识传播的重要载体,具有数字文件难以完全替代的历史价值,因此如何在AI发展和文化保存之间寻找平衡,成为未来需要面对的问题。

人工智能需要大量优质数据推动进步,而社会也需要确保重要知识资源得到合理保存,这两者并非完全对立。

未来,随着AI技术持续发展,企业、法律机构和社会公众仍需要共同探索更加透明、规范的数据使用方式,让技术创新与知识传承能够同步推进。