载入中… | 今日精选 · 实时更新
每日精选全球 AI 与科技资讯
编辑部 · 北京时间 每日 08:00 更新
首页

纽约时报再掀底牌:OpenAI被指在ChatGPT版权案中隐藏关键证据

· · 阅读 5 分钟

一场围绕AI训练数据合法性的世纪诉讼,正在走向更激烈的对抗。美国纽约时报公司近日向联邦法院提交动议,指控OpenAI在ChatGPT版权侵权诉讼中,刻意隐藏了能够识别其输出内容是否包含受版权保护的新闻文章的工具和数据集,并请求法院对OpenAI实施制裁。这一举动,将两家机构之间本就剑拔弩张的法律博弈,推向了一个新的关键节点。

隐藏的证据:到底是什么?

根据纽约时报律师团队提交的文件,OpenAI在证据开示(discovery)阶段,未能完整披露一组内部工具和训练数据集的细节。这些工具据称能够标记或过滤ChatGPT生成内容中,哪些部分直接基于或显著类似于《纽约时报》等新闻机构的原创报道。具体而言,指控涉及以下内容:

内容标识工具: 纽约时报认为,OpenAI拥有或曾开发过一套算法,可以识别模型输出中是否引用了受版权保护的新闻文本片段。但OpenAI在证据交换中,仅提供了部分版本或功能阉割后的信息,隐瞒了该工具的真实能力和完整使用记录。
训练数据集溯源链: 原告指出,OpenAI未完整披露其用于训练ChatGPT的网页抓取数据集中,究竟包含了哪些新闻出版商的网站、抓取频率以及是否进行了版权过滤。纽约时报怀疑,OpenAI实际上有办法区分受版权保护的新闻内容和普通网页,但故意选择不向法院提供这些区分日志。
内部研究记录: 文件还称,OpenAI内部关于“新闻内容与模型输出相似度”的研究报告、工程师笔记以及产品讨论记录,被“选择性保留”,未能纳入证据开示范围。

纽约时报强调,这些被隐藏的证据,恰恰是证明OpenAI是否“明知故犯”地使用受版权保护新闻来训练模型,并从中获利的核心材料。如果属实,这将对OpenAI的抗辩立场构成重大打击。

诉讼升级:从“合理使用”到“证据隐瞒”

这起案件本身已历经数轮交锋。2023年底,纽约时报率先起诉OpenAI及其主要投资方微软,指控其未经授权使用数百万篇新闻文章训练ChatGPT,侵犯了版权,并要求销毁相关模型。OpenAI则一贯援引“合理使用”(fair use)原则抗辩,称其训练行为属于转换性使用,且不构成对新闻市场的直接替代。

然而,随着诉讼进入证据开示阶段,双方的摩擦迅速升级。纽约时报的本次动议,正是针对OpenAI在证据开示中的“不配合”行为。这类动议在复杂商业诉讼中并不罕见,但一旦法院支持,可能带来严重后果:法官可以下令强制OpenAI提供相关材料,甚至作出对OpenAI不利的推断(adverse inference),即在缺乏证据时假设OpenAI确实侵犯了版权。

更重要的是,如果法院认定OpenAI故意隐藏证据,可能触发“制裁”措施,包括罚款、禁止使用某些抗辩理由,甚至直接判定关键事实成立。这将从根本上动摇OpenAI的诉讼策略。

行业涟漪:新闻出版界的集体焦虑

纽约时报的指控并非孤例。目前,包括《华尔街日报》母公司道琼斯、CNN母公司华纳兄弟探索、以及《纽约每日新闻》在内的多家新闻机构,已对OpenAI和微软提起了类似诉讼。此外,在加拿大、英国、德国等地,也有新闻集团就AI训练数据版权问题起诉或威胁起诉大型科技公司。

新闻出版业的集体焦虑,源于一个根本矛盾:高质量新闻内容需要高昂的采编成本,而AI模型却可以轻松抓取、训练并生成摘要或改写版本,从而分流流量和广告收入。更让出版商不安的是,OpenAI等公司迄今未建立透明的内容使用追溯机制。如果连“哪些文章被用于训练”都无法明确,更遑论公平补偿。

本次隐藏证据的指控,进一步加剧了这种不信任。如果OpenAI真的拥有识别受版权保护内容的能力,却选择在诉讼中隐瞒,那么其过去关于“无法区分个人数据与版权内容”的解释,就变得可疑。这不仅是法律问题,更是商业伦理问题。

意义与影响:AI版权判例的“分水岭”

无论本案最终结果如何,它都已成为AI与版权法之间的一次历史性碰撞。法官的裁决,可能为后续类似的诉讼树立先例:

对AI公司: 若法院判定OpenAI在证据开示中存在不当行为,将迫使所有AI开发者在训练数据收集、内部审计和证据保存方面采取更严格合规标准。未来,AI公司可能需要建立类似“版权内容审计日志”的机制,以备法律审查。
对新闻出版商: 如果纽约时报胜诉,将激励更多内容创作者向AI公司提出授权费诉求,推动形成“内容授权+模型训练”的新商业模式,甚至可能改变OpenAI、Google等公司与新闻机构现已签署的支付协议条款。
对监管机构: 全球主要经济体的版权局和反垄断机构,正密切关注此案。美国国会、欧盟委员会以及日本、韩国等地的立法者,都可能根据此案走向,调整AI训练数据的版权例外规则。

目前,OpenAI尚未对纽约时报的制裁动议作出正式回应。但可以预见,下一阶段的法庭辩论将围绕“这些工具和数据集是否真的存在”“OpenAI是否故意隐瞒”等关键事实展开。对于所有关注AI与内容产业未来的人而言,这不仅是法律程序,更是一场关于“谁有权使用人类知识遗产”的深度博弈。