在人工智能与新闻出版业的版权角力中,一场新的风暴正在酝酿。美国《纽约时报》近日向法院提交动议,指控OpenAI在ChatGPT版权诉讼中故意隐藏了能够识别其输出内容是否源自受版权保护新闻文章的工具和数据集,并要求法院对OpenAI实施制裁。这一举动不仅使本就复杂的案件走向更加扑朔迷离,更可能深刻影响大模型训练数据的透明度规则。
案件回溯:从合作谈判到对簿公堂
《纽约时报》与OpenAI的法律纠纷始于2023年底。彼时,该报率先提起诉讼,指控OpenAI未经授权使用其数百万篇新闻文章训练ChatGPT等大模型,构成大规模版权侵权。这起案件被视为测试AI公司使用公开网络文本合法性的一块关键试金石。
在诉讼过程中,双方围绕“合理使用”原则展开了激烈交锋。OpenAI主张其使用公开文本属于转化性使用,符合版权法中的合理使用范畴;而《纽约时报》则坚持认为,ChatGPT能够逐字或近似地复述其文章内容,直接挤占了原作品的流量和订阅收入。双方此前已就证据开示(discovery)阶段的内容多次交锋,但最新动议将矛盾推向了一个新高度。
隐藏的证据:OpenAI 被指“选择性披露”
根据《纽约时报》提交的动议,OpenAI“系统性地隐藏”了若干关键工具和数据集。这些工具包括用于过滤训练数据中受版权保护内容的算法、用于评估模型输出与原始新闻文章相似度的内部评分程序,以及自2018年以来所有模型版本中使用的训练数据索引。
具体而言,《纽约时报》律师团队指出,OpenAI在证据开示阶段仅提供了部分高层次的模型架构信息,却拒绝交出能够直接证明模型是否“记忆”了受版权新闻内容的微观数据。例如,通过与OpenAI内部系统对比,《纽约时报》发现ChatGPT在测试中能够生成几乎所有其曾经引用过的报道的近似复述,但OpenAI却声称这是用户提示工程导致的结果,而非模型本身的数据污染。
动议还特别提到,OpenAI一名关键工程师在离职前曾记录了一份详细的“版权暴露报告”,用于量化模型输出中来自《纽约时报》等来源的内容比例。然而,OpenAI在诉讼中被指从未主动提供该报告,直至《纽约时报》通过第三方分析师发现其存在后才被迫交出。
制裁动议的核心诉求
《纽约时报》此次提出的是“制裁动议”(motion for sanctions),这意味着它认为OpenAI的行为已经违反了法院关于证据披露的命令,甚至可能构成对司法程序的直接阻挠。该报要求法院采取一系列惩罚性措施,包括:
1. 推定不利于OpenAI:要求法官在关键事实认定上直接采纳《纽约时报》的版本,即认定OpenAI的系统性地利用了受版权保护的新闻内容。
2. 证据排除:禁止OpenAI在庭审中使用那些被隐藏或延迟披露的证据,除非其能证明没有故意隐藏。
3. 赔偿加速程序:要求法院加快对损害赔偿金额的评估程序,基于“恶意隐瞒”表现加重惩罚性赔偿。
如果法院支持制裁动议,这将是AI版权诉讼中少有的程序性胜利,可能迫使OpenAI开放更多训练数据细节,从而为其他出版商和创作者提供参考先例。
行业意义:AI 训练数据的透明化将成新常态?
这起事件背后,折射出整个AI行业在版权问题上的根本困境:模型的黑箱特性使其训练数据的透明度极低。即使是模型开发者自身,有时也难以准确追溯某个特定输出是来自授权数据还是侵权内容。当司法系统要求“出示所有相关证据”时,技术上的复杂性变成了法律上的灰色地带。
从行业影响来看,此案可能产生三重效应:
第一,打破“合理使用”保护伞。如果法院认定隐藏证据的行为本身就构成恶意,那么OpenAI等公司此前依赖的“合理使用”抗辩将受到更多质疑。法官可能不再将模型视为单纯的学习工具,而是需要承担更严格的数据责任。
第二,推动数据溯源技术商业化。像“版权暴露报告”这样的内部工具,未来可能成为所有AI公司的标配。帮助开发者识别训练数据来源的第三方审计服务,以及用于检测模型是否记忆了版权内容的检测平台,将迎来巨大的市场机遇。
第三,提升出版业的议价能力。当前多数新闻出版商在与AI公司的授权谈判中处于弱势地位,因为AI公司可以声称公开数据无需付费。《纽约时报》的强硬姿态向整个行业传递了一个信号:即便技术巨头拒绝合作,司法途径也能提供有效杠杆。更多出版商可能会效仿,要求获得类似的数据透明度承诺。
不过,OpenAI方面尚未对制裁动议做出正式回应。其在早期声明中辩称,披露内部工具和数据集可能涉及商业秘密,并且部分证据因法律特权而不应被强制公开。法律观察人士指出,此案的未来走向高度依赖法官对“证据隐藏”程度的判断——是普通诉讼策略中的选择性披露,还是真正违反披露义务的过失行为。
无论如何,这场官司已经超出了两家公司之间的纠葛,正逐渐演变为关于AI训练数据合理获取方式的全球性定调。当《纽约时报》这样的传统媒体巨头选择用法律武器挑战算法的黑箱,我们或许正在见证数字版权史上一个分水岭时刻的到来。