Кросс-секционное исследование, опубликованное в понедельник, пропустило через один классификатор 620,699 переписок в ChatGPT из публичного корпуса пожертвованных данных, используя два разных определения того, что считать разговором о психическом здоровье. По консервативному определению — явный запрос помощи при психологической проблеме — оно выявило 1,317 разговоров, или 0.21% (95% CI 0.20–0.22). По более широкому определению — любая тематическая связь с психическим здоровьем — оно выявило 30,394, или 4.90% (95% CI 4.84–4.95). 23-кратный разброс — результат одного лишь выбора определения.

Что в традиционной подаче понимают неверно

Два неверных прочтения, и первое — со стороны издателя. Собственный индексируемый анонс журнала описывает это как исследование того, как часто подростки используют AI-чатботы, чтобы обсуждать проблемы психического здоровья. Это не так. Единица анализа — публичный корпус разговоров обычных пользователей, в котором вообще нет данных о возрасте. Любой, кто строит заголовок о безопасности подростков на этой строке метаданных, строит его на ошибке в метаданных. Второе: заголовочную цифру будут подавать как распространённость, но это не распространённость среди людей. Это доля разговоров в пожертвованном публичном корпусе, оценённая классификатором, чья положительная прогностическая ценность составляет 67% — примерно треть его положительных срабатываний неверна. Чувствительность — 87%, специфичность — 95%, отрицательная прогностическая ценность — 98%.

Почему именно разброс — это и есть вывод

"Сколько людей приносят проблемы психического здоровья к чатботам" сейчас цитируют разработчики моделей, регуляторы и адвокаты истцов, и у каждого из них есть интерес к разному ответу. Эта работа показывает, что цифра — это политический выбор, замаскированный под измерение: её можно сдвинуть в 23 раза, не трогая данные, просто решив, считается ли беглое упоминание стресса. Ответ авторов конструктивен: они предлагают многоуровневую таксономию — кризис и высокий риск, клинически оформленные случаи, а также широкий аффективный или межличностный уровень — чтобы любой, кто цитирует число, был вынужден указывать, какой именно уровень имеется в виду.

Заявленные ограничения

Опора на публичный корпус без внешней валидации; возможная ошибочная классификация неоднозначных выражений дистресса; и отсутствие проверки того, улучшает ли мониторинг на основе таксономии какие-либо исходы. Работа финансировалась грантом National Institute of Mental Health.

Как это использовать

Любой единственный процент использования чатботов в сфере психического здоровья следует считать неполным, если он не указывает своё определение, знаменатель и точность классификатора. Большинство цифр, которые сейчас циркулируют, не указывают ни одного из трёх.