Google объявила Gemini 3.5 Transcribe 26 августа в 17:00 UTC — модель преобразования речи в текст, рассчитанную на голосовые интерфейсы. В публикации приведены четыре значения Word Error Rate. Два из них будут цитировать; ещё два описывают мультиязычную производительность.
Две пары
Первую пару приписывают Artificial Analysis, внешнему оценщику: модель "достигает среднего значения Word Error Rate (WER) в 4,0% для streaming и 2,6% для non-streaming use-cases." Вторая пара — собственный результат Google на мультиязычном бенчмарке FLEURS по основным языкам и локалям: "5,50% WER в streaming mode и 5,04% WER в non-streaming use-cases." Между лучшим и худшим числом в посте разрыв составляет 2,1 раза.
Что не так с распространённой подачей
В обращение идёт число 2,6%, и его связывают с утверждением, что модель поддерживает 85+ языков. Это два разных измерения. 2,6% — средний показатель по тому, что пост называет основными сценариями; мультиязычная цифра на стандартном мультиязычном бенчмарке — 5,04%, то есть почти вдвое выше. Уровень ошибки у модели распознавания речи имеет смысл только вместе с набором языков и условиями аудио, на которых его измеряли, и в этом посте необычно прозрачно опубликованы оба значения. Искажение возникает дальше, когда стороннее число прикрепляют к заявлению о мультиязычности, получая характеристику, которой в исходнике нет.
Публичный предварительный доступ, а не запуск
Статус — public preview. И это важно. К модели можно обратиться через Gemini API в Google AI Studio и через агентскую платформу Gemini Enterprise; она также появляется в Rambler на Android в отдельных странах и на отдельных языках, в приложении Gemini на macOS, а также в Gboard и Google Antigravity. Chrome указан как «скоро». Публичный предварительный доступ не означает обязательств по уровню сервиса, гарантии стабильности цены и уверенности, что конечная точка сохранится в текущем виде.
Почему разрыв в streaming важнее заголовка
В обеих парах streaming хуже, чем non-streaming — 4,0% против 2,6% и 5,50% против 5,04%. Это ожидаемо: потоковая модель фиксирует слова до того, как услышит остальную часть предложения. Но именно streaming-значение определяет работу живых голосовых агентов — сценарий, под который и позиционируется эта модель. Тот, кто оценивает голосовой продукт по 2,6%, сравнивает его с пакетным сценарием в ограниченном наборе условий, тогда как показатель, который будет определять, покажется ли продукт пригодным к использованию, — это мультиязычный streaming-показатель, 5,50%.
