微软于 9 月 4 日In re OpenAI, Inc. Copyright Infringement Litigation 案中提交了两份经过删节的公开简易判决陈述——针对图书原告的是第 1690 号文件,共 42 页;针对新闻原告的是第 1698 号文件,共 46 页。两份文件分析的是同一证据,却得出了相差约 2,500 倍的结果。

同一语料,两种阈值

图书案陈述在第 22 页写道:原告专家“审查了微软基于 LLM 的 Copilot 产品中的 820 万条对话,并发现了 24 条 Copilot 回复,其中包含 30 个匹配词……这对应的重复输出率为 .00029%。而对于图书原告主张的 212 部作品中的 202 部,Shan 在日志中未发现重复输出。”新闻案陈述在第 29 页则基于同样的 820 万条记录称,专家 Tom Goldstein 搜索 16 个词的匹配项后,“只能找到 59,545 条对话”,这“得出了极低的 0.73% 匹配率”。30 个词和 16 个词之间的差异,就是全部区别。

微软先否认、后又依赖的分母

新闻案陈述直截了当地写道:“这 820 万条并非随机抽样——它们是原告因这些对话命中了涉及使用新闻原告网站的关键词而要求提供的聊天记录,因此最有可能包含新闻原告作品。”但仅一页之后,文件又用这个数字作除数,得出 0.73%。用一个为了尽可能命中而汇集的语料算出的比例,只能说明富集样本中的下限,而不是 Copilot 流量的基础比例——而这份陈述自己就提供了这种反驳的两部分。

两项并不属于合理使用的理由

这起 MDL 案被外界视为一场合理使用之争,但微软的四项理由中有两项并非如此。其一是基于缺失 meta tag 的默示许可:微软请求就 2023 年 9 月之后缺少 NOARCHIVE 标记的网页所引发的任何主张作出简易判决。其二是损害赔偿上限——出版商“至多有权就每一期获赔一次,而不是按每篇文章分别获赔”,因为他们将期刊以合集作品登记,援引了 Bryant v. Media Right Prods.。这项理由决定的是责任风险是达到数百万美元还是数十亿美元。

既有表述错在哪里

“820 万条中只有 24 条”这一说法已被单独报道。可这只是微软在同一天、基于同一批日志提交内容的一半。无论读者看到哪一个数字,诚实的说法都应是:该比例取决于法院尚未选定的阈值——Stein 法官必须先作出选择,才能衡量第三项合理使用因素。微软的专家还报告称,只有 1.3% 的终端用户会使用 Copilot 去研究时事。