Z.ai 26 августа опубликовала веса GLM-5.3-Flash на Hugging Face под лицензией MIT. До этого модель анонимно распространялась как скрытая конечная точка. Три детали в model card меняют то, как следует читать этот релиз.

«Flash» — это 320 миллиардов параметров

В карточке указано 320B общих параметров и 18B активных на токен. В номенклатуре любого другого вендора Flash, Mini, Turbo и Lite обычно обозначают небольшую модель. Здесь это обозначает разреженную модель: архитектуру mixture-of-experts, в которой для любого конкретного токена задействуются только 18B из 320B. По стоимости инференса она напоминает 18B-модель; по объему памяти, необходимому для размещения, — нет. Тот, кто читает «Flash» как «работает на скромном железе», понимает это неправильно: чтобы вообще обслуживать модель, нужна емкость для всех 320B в памяти.

Что не так с распространенной трактовкой

Чаще всего цитируют фразу о том, что модель «превосходит GLM-5.2 по всем бенчмаркам и в реальных задачах при в десять раз меньшей цене». Важно, к чему относится это сравнение. Речь идет о GLM-5.2 — предыдущем релизе самой Z.ai, а не о какой-либо frontier-модели другой лаборатории. Десятикратное снижение цены по сравнению с собственной предыдущей генерацией говорит о вашем inference-стеке, а не о вашем положении относительно конкурентов. Эту фразу повторяют так, будто модель в десять раз дешевле frontier-решений, хотя карточка этого нигде не утверждает.

Кто проводил оценки и на каких условиях

Заявленные результаты составляют 84.3 на Terminal-Bench 2.1, 63.4 на Deep-SWE и 55.3 на HLE с инструментами на полном наборе. Условия раскрыты, и они щедрые. Terminal-Bench 2.1 запускался при temperature 1.0 с max_new_tokens 65,536 и шестичасовым тайм-аутом. Deep-SWE использовал шестичасовой тайм-аут и 400K контекста. Для HLE максимальная длина генерации составляла 163,840 токенов. Это самоотчитанные показатели в самостоятельно выбранных harnesses — стандартная практика, а также причина, по которой числа агентных бенчмарков из разных лабораторий редко сопоставимы между собой.

Что дает лицензия MIT

Лицензия — самая однозначная часть этого релиза. MIT не накладывает ограничений по сфере использования, не содержит политики допустимого использования, не вводит порога выручки, после которого меняются условия, и не обязывает публиковать производные работы. По сравнению с community-лицензиями, которыми обычно сопровождаются большинство open-weight релизов сопоставимого масштаба, это заметно более свободные условия. Для модели с 320B параметров и оцененным контекстом в 300,000 токенов именно это сочетание — масштаб почти frontier-класса и полностью свободные условия — и является настоящей новостью, а не тем, на что указывает заголовок про цену.