Reddit 已经花了一年时间起诉抓取者。8月28日,其中一名被告回击:Reddit, Inc. v. SerpApi LLC 在纽约南区联邦法院的案卷第119号记录为“Answer to Amended Complaint AND Counterclaim”,而这项反诉是一项反垄断反诉。

理论基础

SerpApi 主张依据《谢尔曼法》第2条构成垄断和意图垄断,并提出四项确认之诉。其所称市场被界定得狭窄而明确:用于搜索索引以及 AI 系统训练和 grounding 的、面向主题分类的线程式论坛中大规模真实人类对话数据的程序化访问。事实核心是一系列事件——2024年初宣布与一家搜索公司的数据合作,随后在2024年中期修改 robots.txt,使程序化访问仅对这一家合作方开放,而 Reddit 在自身案件中依赖的技术措施直到数月后才部署。所请求的救济包括三倍赔偿,以及禁止提供会根据许可状态进行歧视的、针对特定请求者的 robots.txt 指令的禁令。

常见说法哪里错了

有四点需要纠正,而且都很关键。这是一份诉状,不是裁决——尚无法官对其进行审查,而且当时另一被告提出的驳回动议仍在审理中。是其中一名被告提交了该文件:案卷显示,同一天另一方提交了单独、普通的答辩,但没有反诉,因此“被告们提起反诉”这一说法是错误的。没有监管机构介入——这是一项私人反诉,不是反垄断调查。并且没有提出具体美元金额;所请求的是实际损害赔偿的三倍。

最薄弱的一环

市场界定是此案最容易遭受攻击的地方。由带主题的论坛中的人类线程对话构成的市场,几乎等同于单一产品市场,而单一产品市场界定是《谢尔曼法》第2条诉求在驳回阶段最常见的失败模式。SerpApi援引的抓取先例是访问案件,而非反垄断案件,并不意味着限制 robots.txt 违反《谢尔曼法》。

但它仍值得关注

Reddit 自身的诉讼建立在DMCA 第1201条规避和不正当竞争之上,而不是建立在用户帖子的所有权之上。反诉则反转了这一框架:如果平台的独家数据交易会带来反垄断风险,那么 AI 训练数据市场的结构就会发生变化,无论本案谁胜谁负。