Kakao ha pubblicato su Hugging Face i pesi del tokenizzatore vocale LM-SPT il 2 settembre alle 05:32 UTC, con il commit iniziale della release alle 05:49 UTC e il repository del codice associato caricato alle 05:10 UTC. Il modello è un tokenizzatore vocale neurale a 12,5 Hz su audio a 24 kHz, con 8 codebook — un codebook semantico da 16.384 voci più sette codebook residuali acoustic VQ da 4.096, con un downsample di 1920×.

Ciò che la formulazione comune sbaglia

Dire che “Kakao open-source un tokenizzatore vocale” lascia intendere che sia utilizzabile. Il codice è Apache-2.0; i pesi sono CC BY-NC 4.0 — niente uso commerciale. E Kakao non ha scelto questa licenza. La model card afferma che i pesi riportano “la stessa licenza del dataset Emilia usato per l'addestramento”. La restrizione deriva dai dati, passa dal checkpoint e arriva a chiunque lo scarichi.

La trappola per chi controlla in fretta

Risalendo alla fonte per verificare, il quadro peggiora. Il repository Emilia su Hugging Face è taggato cc-by-4.0, ma i suoi termini separano il corpus: Emilia è CC-BY-NC e solo Emilia-YODAS è CC-BY. Il tag di licenza leggibile dalle macchine sul dataset è più permissivo del testo effettivo del dataset, e la card di Kakao adotta la lettura più rigorosa e corretta. Un team che facesse due diligence sulla licenza leggendo i metadati invece dei termini lo considererebbe conforme, ma si sbaglierebbe.

Due correzioni minori

I pesi vengono distribuiti senza il codice del modello — il pacchetto lmspt va installato separatamente. E non si tratta di un nuovo risultato di ricerca: il paper è una preprint su arXiv di giugno 2025, pubblicata ora su IEEE TASLP 2026, vol. 34, pp. 3714–3727. Il primo commit del repository del codice precede i pesi di dodici giorni. Sono nuovi solo i pesi. Le lingue della card sono inglese, cinese, coreano, tedesco, francese e giapponese; il decoder semantico ausiliario gira a 16 kHz, non a 24.

Perché vale in generale

Quasi ogni stack open di speech-LLM si allena sullo stesso ristretto numero di corpus raccolti dal web. Se il corpus non è commerciale, lo è anche il checkpoint, a prescindere da quanto permissivo sembri il repository del codice — e il campo licenza della piattaforma non vi avviserà.