Kakao опубликовала веса своего speech tokenizer LM-SPT на Hugging Face 2 сентября в 05:32 UTC, при этом первый коммит в релизе был сделан в 05:49 UTC, а связанный репозиторий с кодом был загружен в 05:10 UTC. Модель представляет собой нейронный speech tokenizer с частотой 12,5 Hz для аудио 24 kHz с 8 codebooks — одним семантическим codebook на 16 384 элемента плюс семью акустическими residual-VQ codebooks по 4 096 элементов, при 1920× downsample.
Что обычно понимают неправильно
Формулировка «Kakao открыла исходный код speech tokenizer» подразумевает, что он пригоден к использованию. Код распространяется по Apache-2.0; веса — по CC BY-NC 4.0, то есть без коммерческого использования. И Kakao не сама выбрала эту лицензию. В model card сказано, что веса несут «ту же лицензию, что и датасет Emilia, использованный для обучения». Ограничение идет от данных, через checkpoint, ко всем, кто его скачивает.
Подвох для тех, кто проверяет наспех
Если подняться выше по цепочке, чтобы проверить это, картина становится еще хуже. Репозиторий Emilia на Hugging Face помечен как cc-by-4.0, но его собственные условия разделяют корпус: Emilia — это CC-BY-NC, а только Emilia-YODAS — CC-BY. Машиночитаемый лицензионный тег датасета более разрешительный, чем фактический текст условий, и card Kakao отражает более строгую и корректную трактовку. Команда, проводящая лицензионную проверку по метаданным, а не по условиям, посчитала бы это допустимым — и ошиблась бы.
Два менее крупных уточнения
Веса поставляются без кода модели — пакет lmspt нужно устанавливать отдельно. И это не новый результат исследования: статья — это arXiv preprint от июня 2025 года, который теперь опубликован в IEEE TASLP 2026, том 34, стр. 3714–3727. Первый коммит в репозитории кода появился на двенадцать дней раньше весов. Новыми являются только веса. Языки card — английский, китайский, корейский, немецкий, французский и японский; вспомогательный семантический декодер работает на 16 kHz, а не на 24.
Почему это важно в более широком смысле
Почти каждый открытый стек speech-LLM обучается на одних и тех же нескольких собранных корпусах. Если корпус некоммерческий, то и checkpoint тоже, независимо от того, насколько разрешительно выглядит репозиторий с кодом, — и лицензионное поле платформы вас об этом не предупредит.
