Thomson Reuters в понедельник представила «Thomson» — свою первую собственную проприетарную большую языковую модель, созданную «на базе сильного open-source-фундамента» при заявленных затратах в $40 млн на специалистов и вычислительные ресурсы. К модели прилагается утверждение, что «по нашим ранним оценкам Thomson находится на одном уровне с новейшими frontier-моделями в широком диапазоне задач».
Что не так с привычной подачей
Формулировка «Thomson Reuters создала frontier-модель за $40 млн» содержит три отдельные ошибки. Во-первых, frontier-модель не создавалась. Компания дообучила безымянную базовую open-weights-модель, так что $40 млн покрывают только дополнительную работу — стоимость обучения самой базовой модели, почти наверняка измеряемая девятизначной суммой и оплаченная кем-то другим, в сравнение вообще не включена. Во-вторых, заявление о паритете с frontier-моделями — это собственная ранняя внутренняя оценка компании, изложенная от первого лица, без названного бенчмарка, без опубликованных чисел и без упоминания какой-либо сторонней оценки в релизе. В-третьих, модель пока не поставляется. Первый запуск — это одна функция, Tabular Analysis, внутри одного продукта, CoCounsel Legal, в неуточненном «предстоящем релизе». Сегодня доступна для загрузки лишь «маленькая» версия на Hugging Face, ограниченная академическим и некоммерческим использованием. Основная модель не является open-weight.
Цифра, которую стоит прочитать дважды
Thomson «обучена менее чем на 10% контента Thomson Reuters на данный момент». Релиз подает это как запас для роста, и это действительно так. Но это одновременно и признание того, что data moat — вся стратегическая основа — пока почти не задействован, а модель, с которой сравнивают frontier-уровень, не тестировалась на корпусе, который, как предполагается, и должен делать ее особенной.
Почему экономика важнее самого заявления
Это пока самый ясный показатель того, как работает escape hatch open-weights. Если отраслевой игрок может взять open-base, потратить $40 млн на специалистов и вычисления и при этом приблизиться по качеству к frontier-моделям в своей вертикали, то аргумент в пользу оплаты frontier-API по ставкам для профессионального софта слабеет — а значит, с точки зрения лабораторий, слабеет и аргумент в пользу того, чтобы что-либо делать open-weight. Этот спор идет прямо сейчас: релиз выходит спустя несколько недель после того, как Meta открыла веса Muse Glimmer, и через месяц после программного документа Mistral о позиции open-weights.
Что могло бы поставить точку
Названная базовая модель, названный бенчмарк и число. Пока Thomson Reuters не опубликует хотя бы что-то из этого, фраза «на уровне frontier-моделей» остается заявлением о модели, которую никто за пределами компании не измерял.
