Reddit ha trascorso un anno a fare causa agli scraper. Il 28 agosto uno di loro ha risposto: l’atto depositato come 119 in Reddit, Inc. v. SerpApi LLC nel Southern District of New York è registrato come "Answer to Amended Complaint AND Counterclaim", e la controdomanda è di antitrust.

La tesi

SerpApi sostiene monopolizzazione e tentata monopolizzazione ai sensi della Sezione 2 dello Sherman Act, oltre a quattro capi di accertamento dichiarativo. Il mercato allegato è ristretto e definito con precisione: accesso programmatico a dati conversazionali umani autentici su larga scala, in forum a thread organizzati per argomento, per l’indicizzazione dei motori di ricerca e per l’addestramento e il grounding di sistemi di IA. Il nucleo fattuale è una sequenza — un accordo sui dati con una società di ricerca annunciato all’inizio del 2024, seguito a metà 2024 da una modifica al robots.txt che ha lasciato l’accesso programmatico aperto a quell’unico partner, mentre la misura tecnica su cui Reddit fa affidamento nella propria causa non è stata implementata fino a mesi dopo. Tra i rimedi richiesti figurano i danni triplicati e un’ingiunzione contro la pubblicazione di direttive robots.txt specifiche per il richiedente che discriminino in base allo status di licenza.

Ciò che la cornice comune sbaglia

Quattro correzioni, tutte sostanziali. Si tratta di un atto di parte, non di una decisione — nessun giudice lo ha esaminato, e una mozione di rigetto presentata da un altro convenuto era ancora pendente quando è stato depositato. Lo ha presentato un solo convenuto: il docket mostra, lo stesso giorno, una risposta separata e ordinaria di un’altra parte, senza controdomanda, quindi "i convenuti hanno riconvenuto" è errato. Non è coinvolto alcun regolatore — si tratta di una controdomanda privata, non di un’indagine antitrust. E non è indicata alcuna cifra in dollari; la richiesta è di danni effettivi, triplicati.

L’anello più debole

È la definizione del mercato il punto su cui si concentrerà l’attacco. Un mercato composto dalla conversazione umana in thread sui forum tematici è molto vicino a un mercato di un solo prodotto, e le definizioni di mercato su un solo prodotto sono il classico punto di fallimento delle cause ai sensi della Sezione 2 nella fase di rigetto. I precedenti sullo scraping citati da SerpApi sono casi sull’accesso, non sull’antitrust, e non stabiliscono che limitare il robots.txt violi lo Sherman Act.

Perché vale comunque la pena seguirla

La causa di Reddit si fonda sulla elusione della Sezione 1201 del DMCA e sulla concorrenza sleale, non sulla titolarità dei post degli utenti. La controdomanda rovescia l’impostazione: se gli accordi esclusivi sui dati delle piattaforme diventano un’esposizione antitrust, la struttura del mercato dei dati per l’addestramento dell’IA cambia a prescindere da chi vinca questa causa.