В понедельник судья Eumi K. Lee из Северного округа Калифорнии отклонила ходатайство истцов о предоставлении relief от discovery-распоряжения магистратского судьи по делу In re Google Generative AI Copyright Litigation. Практический эффект таков: Google не обязана указывать, какие именно защищённые авторским правом произведения членов класса находятся в её обучающих наборах данных. В тот же день были вынесены ещё два распоряжения, приближающие рассмотрение сертификации класса.
Ключевая фраза
В постановлении дословно приводится собственная позиция Google: "There is no list of works Google used for training, and no way for Google to generate one. The only record and the only means of determining what materials Google used to train its AI models is the training data itself." Магистратский судья Susan van Keulen пришла к выводу, что "only the training datasets will reveal what putative class works were ultimately used," а также что запрос истцов означал бы для Google дублирование работы, которую уже выполнил их собственный предложенный эксперт, — "redundant and not proportional to the needs of the case."
Что неверно в привычной формулировке
Фраза «суд постановил, что Google не обязана говорить, на чём она обучалась» искажает суть сразу в трёх отношениях. Во-первых, в части стандарта: relief по Rule 72(a) может быть предоставлено только если распоряжение "clearly erroneous or contrary to law," и в постановлении судьи Lee прямо сказано, что она "may not simply substitute" собственное суждение вместо суждения магистратского судьи. Она не решала, может ли Google предоставить такой список; она решила, что не нашла явной ошибки в чужом решении о том, что этого делать не нужно. Во-вторых, фраза Google — это процессуальная позиция, процитированная судом, а не судебный вывод о факте. Реальная логика суда состоит в том, что van Keulen не просто поверила Google на слово — она оценила показания, данные в ходе допросов. В-третьих, речь идёт о discovery. Это никак не затрагивает добросовестное использование, нарушение прав или убытки.
Почему discovery-решение имеет такой вес
Определение конкретных произведений, вошедших в обучающий корпус, — это несущая конструкция любого коллективного иска, связанного с данными для обучения ИИ. Без списка произведений ascertainability и predominance по Rule 23 становятся существенно сложнее — класс приходится определять через то, что никто не может перечислить. Это решение перекладывает эту нагрузку на собственный анализ истцами выборочных наборов данных, и оно вынесено в момент, когда ходатайство о сертификации класса находится на рассмотрении у того же судьи.
Что остаётся в силе
Ходатайство о сертификации класса, четыре ходатайства об исключении экспертов, ходатайство о санкциях и ходатайство о вмешательстве. Ответ Google в объёме двух страниц по дополнительным правовым основаниям должен быть представлен 8 сентября. Третье распоряжение того же дня прекратило семь заменённых ходатайств и прямо указывает, что оно носит административный характер и не затрагивает права сторон — это техническое оформление, а не семь отказов.
