载入中… | 今日精选 · 实时更新
每日精选全球 AI 与科技资讯
编辑部 · 北京时间 每日 08:00 更新
首页

AI训练数据饥渴:科技公司被指销毁稀有古籍,书商发出警告

· · 阅读 5 分钟

当大语言模型对文本数据的渴求达到指数级增长,科技巨头们正将目光从互联网转向更隐秘的角落——私人藏书室和古籍档案馆。但一种令人不安的趋势正在浮现:稀有书商发现,某些科技公司在获取独家训练数据的过程中,正在物理性地销毁那些本已数量稀少的绝版书籍。这不仅是商业伦理的灰色地带,更可能让人类文化遗产生出难以愈合的裂缝。

数据“淘金热”转向物理世界

自GPT系列模型证明“更多数据=更强智能”的朴素逻辑后,互联网上公开可用的文本资源几乎被吃干榨净。网页文本、维基百科、电子书库……这些传统数据源的低垂果实早已被摘遍。为了追求模型在特定领域(如历史、文学、法律)的纵深理解,科技公司开始寻求更罕见、更垂直的语料——那些从未被数字化、只存在于纸质形态中的稀有版本。

这些书籍往往发行量极小,存世量不足百本,甚至只有图书馆或私人藏家手中才有孤本。它们包含的不仅是文字,更是特定历史时期的印刷工艺、装帧设计、边注评点,是文化基因的活体标本。然而对于AI团队而言,它们只是“未被标注的文本”,是一行行等待被OCR扫描后投入训练的数据。

稀有书商的亲历:书籍在“合作”后被损毁

多位欧美稀有书商在接受采访时透露,近年来常有自称“学术团队”或“数据研究公司”的人士联系他们,提出购买或短期租借某些特定主题的稀有书籍。合作条款通常包括:支付远超市场价的费用,但要求书商允许他们“完全处理”书籍样本。一些书商在交易后发现,归还的书籍被拆解、裁剪,甚至整页被撕毁,仅剩残骸。

更激进的做法是直接购买孤本,然后在“内部实验室”中进行切割扫描——为了获得无遮挡的高分辨率图像,必须把书脊切开,使每一页变成单张纸。这种物理拆解意味着书籍作为历史文物价值的彻底消失。一位不愿透露姓名的伦敦书商描述:“他们拿走了上世纪30年代一本关于南美民俗的私人印刷手记,全球仅剩三本。几个月后他们归还了一盒零散纸片,说已扫描完毕。那本书就此变成了一套‘数字副本’,而纸质真品已经消亡。”

法律监管真空与数据溯源困境

目前,大多数国家的版权法和文化遗产保护法对于“物理复制用于AI训练”的行为缺乏明确界定。如果科技公司购买的是孤本所有权,理论上可以对其进行任何操作,但书商往往基于信任而没有在合同中加入保护性条款。即便有条款,若对方以“学术研究”名义使用,事后追责也极其困难。

更大的隐患在于AI模型输出的可溯源性。当模型生成一段关于19世纪某次矿难细节的文字时,用户无法知道这些信息是否来自一本仅存于科技公司内部数据库、但外界已无法查证的绝版史料。这意味着,科技公司实际上通过这些被销毁的书籍,垄断了对某些历史片段的解释权。未来学者想要验证模型输出,面对的可能是“原始资料已不存在”的空白。

行业影响:AI发展不应以文化灭绝为代价

这种担忧并非杞人忧天。早在2018年,就有报道称一些初创公司大量购入旧书进行批量扫描,过程中不可避免地损毁了老旧纸张。如今随着AI模型规模膨胀数百倍,这种行为从“偶然事件”变成了“系统性需求”。稀有书商群体已经意识到,他们不仅是书籍商人,更是文化遗产的临时托管人。部分书商开始联合起来,在交易合同中明确禁止任何形式的有损拆解,并要求科技公司提供详细的数字副本交付计划。

对于AI行业而言,这同样是一个值得反思的信号。模型的知识广度与深度,不应建立在物理世界的不可逆破坏之上。许多文化机构(如大英图书馆、互联网档案馆)已经提供了海量数字化资源,但科技公司对“独家数据”的痴迷正在滑向危险边缘。也许更负责任的路径是:优先与图书馆、博物馆合作进行非侵入式数字化,或利用已有的公开数据集提升模型能力,而不是为了微小边际收益去销毁那些人类好不容易保存下来的孤本。

当AI开始谈论历史,它应该说的是真相,而不应该是因为真相的原始载体已经被自己抹去。稀有书籍的每一次物理消亡,都是人类集体记忆的一次永久失忆。科技公司若想赢得未来,必须先学会敬畏过去。