曾经以在线书店起家的亚马逊,如今被曝出将大量稀有书籍直接销毁,用于获取训练大语言模型(LLM)的高质量数据。这一行为不仅引发藏书界与学术界的强烈抗议,也再次将AI训练数据获取的伦理边界推向风口浪尖。
从“卖书者”到“毁书者”:亚马逊的AI野望
起家基因与数据饥渴
亚马逊创始人杰夫·贝佐斯最初选择卖书,正是因为书籍拥有标准化的SKU(库存单位)和庞大的品类,便于线上销售。如今,亚马逊已成长为全球云计算与AI巨头,旗下AWS的AI模型训练需要海量、高质量、低重复的文本数据。而互联网上的公开语料(如网页、维基百科、社交媒体)已被各大模型反复“咀嚼”,边际效益递减。稀有书籍——尤其是那些从未被数字化、版权归属清晰、内容独特且具有深度学术价值的著作——成为AI训练的金矿。
销毁流程:扫描后“物理清理”
据知情人士透露,亚马逊内部设立了一个专门的“数据采集”项目,从二手书市场、图书馆、私人收藏家手中收购或租借珍贵的绝版书、初版书、甚至手稿。这些书籍在被高精度扫描或OCR(光学字符识别)处理后,会直接进入销毁流程——粉碎、焚烧或作为废纸回收。亚马逊的理由是:这些书籍的版权或使用协议只允许“一次性使用”,且需要确保后续不会泄露给其他模型或竞争对手。更隐晦的动机是,防止其他公司通过同一批稀有书籍获得相同的训练优势。
稀有书籍的独特价值
相比普通书籍,稀有书籍通常包含更严谨的学术语言、更复杂的逻辑结构、更丰富的文化背景,以及大量未被数字化的历史文献。例如,18世纪的议会辩论记录、19世纪的科学论文汇编、20世纪初的冷门学科专著——这些内容在互联网上几乎不存在,对于提升LLM在专业领域(如法律、历史、医学)的推理能力至关重要。OpenAI、Google等公司也曾通过类似方式获取数据,但亚马逊作为前书商的“近水楼台”优势更加明显,它拥有全球最大的书籍流通渠道和供应链。
冲突爆发:学术界的愤怒
当一位哈佛大学历史教授发现,自己向亚马逊捐赠的一批19世纪地理考察日记(仅存世两套)被亚马逊列为“已销毁”时,事件才被曝光。随后,多家图书馆、收藏协会和AI伦理组织联合谴责亚马逊“以文化为代价喂饱算法”。值得注意的是,亚马逊的“销毁”行为并非完全违法——许多稀有书籍的版权已过期,且购买或受赠时用户签署了含糊的“同意数据处理”条款。但道德上,这种行为被批为“文化资产的绝育”:它们不再被人类阅读,只为机器提供一次性的训练燃料。
更深的隐忧:数据垄断与知识熵增
一旦这些稀有书籍被销毁,人类将永久失去这些知识实体。即便亚马逊的模型能“记住”其内容,但模型本身是黑箱,且存在幻觉、遗忘和版本迭代风险。学者们担心,未来历史研究可能不得不依赖亚马逊的API来获取“已消失的文献”,从而形成数据垄断。此外,这种做法可能催生一个灰色市场:以“训练AI”为名,大规模收购并销毁文化遗产,导致知识真空,最终使AI模型成为唯一的知识保管者,而人类反而失去对原始文本的访问权。
行业意义:AI训练成本的伦理代价
亚马逊此举并非孤例。在AI模型参数规模动辄万亿的当下,高质量文本数据已成为最稀缺的资源。各大公司都在竞相挖掘“未被污染的”语料:从医院病历、法庭记录到私人信件,再到如今的稀有书籍。但亚马逊的特殊之处在于,它曾是全球最大的“知识传播者”,如今却成为“知识终结者”。这场争议揭示了AI行业的一个深层悖论:为了创造更智能的机器,我们是否必须牺牲人类文明的物理载体?训练数据的“数据稀缺性”与“文化完整性”之间的矛盾,恐怕没有简单的技术解决方案。
未来,或许需要建立一套严格的数据伦理规范:明确禁止销毁不可复制的文化遗产,推动AI公司采用“数据租赁”而非“数据销毁”模式,并建立公共知识库供所有模型公平访问。否则,当AI学会所有的书,而人类却再也找不到那些书时,我们收获的究竟是更强大的智能,还是更贫瘠的文明?