Kakao publicó en Hugging Face los pesos de su tokenizador de voz LM-SPT el 2 de septiembre a las 05:32 UTC, con el commit de lanzamiento inicial a las 05:49 UTC y el repositorio de código asociado enviado a las 05:10 UTC. El modelo es un tokenizador neuronal de voz de 12,5 Hz sobre audio de 24 kHz con 8 codebooks: un codebook semántico de 16.384 entradas más siete codebooks acústicos residual-VQ de 4.096, con un downsample de 1920×.

Lo que falla en el enfoque habitual

“Kakao libera como código abierto un tokenizador de voz” sugiere que se puede usar. El código es Apache-2.0; los pesos son CC BY-NC 4.0: sin uso comercial. Y Kakao no eligió esa licencia. La ficha del modelo dice que los pesos tienen “la misma licencia que el conjunto de datos Emilia usado para el entrenamiento”. La restricción fluye desde los datos, a través del checkpoint, hasta cualquiera que los descargue.

La trampa para quien lo comprueba con rapidez

Si se retrocede a la fuente para verificarlo, el panorama empeora. El repositorio Emilia en Hugging Face está etiquetado como cc-by-4.0, pero sus propios términos dividen el corpus: Emilia es CC-BY-NC, y solo Emilia-YODAS es CC-BY. La etiqueta de licencia legible por máquina del conjunto de datos es más permisiva que el texto real del conjunto de datos, y la ficha de Kakao refleja la interpretación más estricta y correcta. Un equipo que hiciera diligencia sobre licencias leyendo metadatos en lugar de los términos quedaría conforme y se equivocaría.

Dos correcciones menores

Los pesos se publican sin el código del modelo: el paquete lmspt debe instalarse por separado. Y esto no es un nuevo resultado de investigación: el artículo es un preprint en arXiv de junio de 2025, ahora publicado en IEEE TASLP 2026, vol. 34, pp. 3714–3727. El primer commit del repositorio de código antecede a los pesos en doce días. Solo los pesos son nuevos. Los idiomas de la ficha son inglés, chino, coreano, alemán, francés y japonés; el decodificador semántico auxiliar funciona a 16 kHz, no a 24.

Por qué esto es extrapolable

Casi todas las pilas abiertas de modelos de voz y LLM se entrenan con los mismos pocos corpus rastreados. Si el corpus no es comercial, el checkpoint tampoco lo es, por muy permisivo que parezca el repositorio de código; y el campo de licencia de la plataforma no lo advertirá.