围绕 ChatGPT 的版权之争,如今变成了关于 OpenAI 在法庭上对法官说了什么的争论。7月9日,周四,由 6 家新闻机构组成的联盟请求曼哈顿一名联邦法官制裁 OpenAI,理由是其所谓的证据开示不当:OpenAI 声称自己在技术上无法检索训练数据和聊天记录中受版权保护的新闻内容,但内部实际上早已这样做过。

谁提出了申请

这项动议提交于 纽约南区联邦法院,申请方包括 The New York TimesNew York Daily News 以及另外十多家新闻机构,其中有 Chicago Tribune 和其他 Tribune Publishing 及 MediaNews Group 旗下报纸、Santa Rosa Press DemocratZiff DavisThe InterceptCenter for Investigative Reporting。由《纽约时报》于 2023年12月27日 以 OpenAI 和共同被告 Microsoft 为对象提起的基础诉讼,目前由法官 Sidney H. Stein 审理,并于 2025 年 4 月在驳回撤诉动议后继续推进。

证词内容

争议焦点是 Vinnie Monaco,OpenAI 的隐私工程负责人。他在 4月 作为企业证人接受取证,之后因初次出庭准备不足,被治安法官要求返回继续接受 3.5 小时讯问。原告称,Monaco 证实 OpenAI 曾对其训练语料和模型输出进行内部检索,专门查找受版权保护的新闻内容;公司还建立了一个约 7800万 条去标识化 ChatGPT 对话的数据库,而这项工作在 第一家新闻原告提起诉讼之前 就已开始。另据原告描述,OpenAI 还在名为 Giraffe 的项目下开发了一种用于检测“原样复述”的工具,即一个 “Bloom” 过滤器,这一工具是在诉讼出现后不久建立的。

他们要求什么

除了制裁之外,出版机构还请求法院拒绝接受 OpenAI 提交的 2000万条聊天记录样本,称其不能可靠代表完整记录。对该动议的报道显示,原告寻求的救济包括金钱罚款、特别陪审团指示以及其他措施。他们指控 OpenAI 删除了或使 数十亿 条相关对话无法检索,其中一些发生在法院下达保全命令之后。原告律师 Ian B. Crosby 表示:“如果 OpenAI 真诚地认为复制我们客户的新闻内容属于合理使用且合法,它就不会隐瞒自己确实这样做过的事实。” 联合律师 Steven Lieberman 则说得更直接:这项动议“请求法院惩罚 OpenAI,因其隐瞒并销毁了显示 ChatGPT 如何被盗用新闻内容训练的证据”。

OpenAI 的回应

发言人 Drew Pusateri 表示:“随着《纽约时报》一案持续削弱,而且他们被迫撤回针对我们的部分主张,他们仍在坚持侵入与本案无关人士隐私的做法,包括提出这些明显虚假的指控。” Stein 法官尚未作出裁定。