Microsoft presentó dos escritos públicos redaccionados en apoyo del juicio sumario en In re OpenAI, Inc. Copyright Infringement Litigation el 4 de septiembre — el Documento 1690 para los demandantes de libros, 42 páginas, y el Documento 1698 para los demandantes de noticias, 46 páginas. Ambos analizan la misma prueba. Llegan a tasas que difieren en un factor de aproximadamente 2.500.

El mismo corpus, dos umbrales

El escrito sobre libros, en la página 22: el experto de los demandantes "revisó 8,2 millones de conversaciones del producto Copilot de Microsoft basado en LLM y encontró 24 respuestas de Copilot que incluían 30 palabras coincidentes … Esa es una tasa de repetición del .00029%. Y para 202 de las 212 obras alegadas por los Demandantes de libros, Shan no encontró repetición en los registros". El escrito sobre noticias, en la página 29, sobre los mismos 8,2 millones: el experto Tom Goldstein buscó coincidencias de 16 palabras y "solo pudo encontrar 59.545 conversaciones", lo que "arroja una ínfima tasa de coincidencias del 0,73%". Treinta palabras frente a dieciséis es toda la diferencia.

El denominador que Microsoft rechaza y luego utiliza

El escrito sobre noticias lo dice con claridad: "Los 8,2 millones no eran aleatorios: eran los chats solicitados por los Demandantes porque contenían palabras clave relacionadas con el uso de los sitios web de los Demandantes de noticias y, por tanto, los más propensos a contener obras de los Demandantes de noticias". Una página después, divide por ese número para obtener el 0,73%. Una tasa calculada sobre un corpus ensamblado para maximizar coincidencias es un suelo sobre una muestra enriquecida, no una tasa base sobre el tráfico de Copilot; y el propio escrito aporta ambas mitades de esa objeción.

Dos fundamentos que no son uso legítimo en absoluto

El MDL se presenta como una disputa sobre uso legítimo. Dos de los cuatro fundamentos de Microsoft no lo son. Uno es una licencia implícita por una metaetiqueta ausente: se solicita sentencia sumaria para cualquier reclamación basada en páginas web que carecían de una etiqueta NOARCHIVE después de septiembre de 2023. El otro es un límite de daños — los editores "tienen derecho como máximo a una indemnización por número, no por artículo", porque registran los números como obras colectivas, citando Bryant v. Media Right Prods. Ese es el fundamento que decide si la exposición alcanza millones o miles de millones.

Qué falla en el marco habitual

"24 en 8,2 millones" se ha difundido de forma aislada. Es la mitad de lo que Microsoft presentó el mismo día, a partir de los mismos registros. Se muestre la cifra que se muestre al lector, la versión honesta es que la tasa depende de un umbral que el tribunal aún no ha elegido — y el juez Stein tendrá que escoger uno antes de valorar el tercer factor del uso legítimo. El experto de Microsoft también informa de que solo el 1,3% de los usuarios finales utiliza Copilot para investigar noticias de actualidad en absoluto.