AI Observatory — публичная платформа, агрегирующая реальные разговоры с ИИ, переданные с согласия пользователей по семи наборам данных, — применила к своему корпусу подход Anthropic к классификации по рабочим запросам. Результаты 18 августа сообщило MIT Technology Review.

Что удаляет фильтр

Почти половина — 48% — разговоров была бы отфильтрована как не относящаяся к работе. Отбрасываемая часть — не случайный остаток. По сравнению с опубликованным анализом исключённые разговоры показали заметно более высокие доли тем, связанных со здоровьем и отношениями (44,2% против 31,2%), взрослых и незаконных тем (7,9% против 2,1%), домогательств и ненависти (27,5% против 5,66%) и сексуального контента (16,7% против 2,4%).

Что неверно в распространённом изложении

Это не означает, что лаборатория что-то скрыла. Методология, созданная для изучения экономического использования ИИ, и должна исключать нерабочие разговоры; в этом и состоит её заявленная цель. Речь о том, что происходит, когда такие цифры выходят за рамки своей методологии и начинают цитироваться как описание того, как люди вообще используют чат-боты. Половина, которую удаляют, — непропорционально чувствительная половина, а значит, любая публичная дискуссия, опирающаяся на статистику использования по рабочей классификации, строится на выборке, которая систематически исключает именно те взаимодействия, которые с наибольшей вероятностью вызвали бы вопросы.

У сравнения есть и вполне серьёзные ограничения, и они работают против вывода. Доноры самоотобранные — люди, добровольно передающие логи чатов исследовательскому проекту, не представляют случайную выборку пользователей, и нет очевидных оснований считать, что они смещены так же, как население в целом. Кроме того, корпус охватывает период 2023–2025 годов, то есть описывает предыдущую генерацию чат-ботов, а не те модели, которые поставляются сейчас.

Почему независимые измерения редки

Почти всё, что общество знает о том, как люди используют ИИ, поступает от компаний, которые его продают, — измеряется по их собственным правилам, на данных, которых никто другой не видит. Корпус пожертвованных логов — слабый инструмент по сравнению с этим, но один из немногих, который позволяет любому за пределами лаборатории повторно прогнать опубликованный метод и увидеть, что он исключает.