Kakao a publié les poids de son tokenizer vocal LM-SPT sur Hugging Face le 2 septembre à 05:32 UTC, avec le commit de publication initial à 05:49 UTC et le dépôt de code associé poussé à 05:10 UTC. Le modèle est un tokenizer vocal neuronal à 12,5 Hz sur un audio de 24 kHz, avec 8 codebooks — un codebook sémantique de 16 384 entrées, plus sept codebooks acoustiques de residual-VQ de 4 096, avec un sous-échantillonnage de 1920×.

Ce que l’interprétation courante présente mal

Dire que « Kakao open-source son tokenizer vocal » laisse entendre qu’il est exploitable. Le code est sous Apache-2.0 ; les poids sont sous CC BY-NC 4.0 — pas d’usage commercial. Et Kakao n’a pas choisi cette licence. La fiche du modèle indique que les poids portent « la même licence que l’ensemble de données Emilia utilisé pour l’entraînement ». La restriction découle des données, passe par le checkpoint, puis s’applique à toute personne qui le télécharge.

Le piège pour quiconque vérifie trop vite

En remontant à la source pour vérifier, le tableau se dégrade. Le dépôt Emilia sur Hugging Face est étiqueté cc-by-4.0, mais ses propres conditions répartissent le corpus : Emilia est CC-BY-NC, et seul Emilia-YODAS est CC-BY. Le tag de licence lisible par machine de l’ensemble de données est plus permissif que le texte réel du jeu de données, et la fiche de Kakao reflète la lecture plus stricte, et correcte. Une équipe faisant preuve de diligence sur les licences en lisant les métadonnées plutôt que les conditions passerait à côté et se tromperait.

Deux corrections plus mineures

Les poids sont livrés sans le code du modèle — le package lmspt doit être installé séparément. Et il ne s’agit pas d’un nouveau résultat de recherche : l’article est un préprint arXiv de juin 2025, désormais publié dans IEEE TASLP 2026, vol. 34, p. 3714–3727. Le premier commit du dépôt de code précède les poids de douze jours. Seuls les poids sont nouveaux. Les langues de la fiche sont l’anglais, le chinois, le coréen, l’allemand, le français et le japonais ; le décodeur sémantique auxiliaire fonctionne à 16 kHz, et non 24.

Pourquoi cela vaut plus largement

Presque toutes les piles open source de speech-LLM s’entraînent sur le même petit nombre de corpus collectés. Si le corpus est non commercial, le checkpoint l’est aussi, quelle que soit la permissivité apparente du dépôt de code — et le champ de licence de la plateforme ne vous avertira pas.