Kakao 于 9 月 2 日 05:32 UTC 将其 LM-SPT 语音分词器的权重发布到 Hugging Face,初始发布提交时间为 05:49 UTC,配套代码仓库的推送时间为 05:10 UTC。该模型是一个针对 24 kHz 音频的 12.5 Hz 神经语音分词器,采用 8 个 codebook——其中包括一个拥有 16,384 个条目的语义 codebook,以及七个拥有 4,096 个条目的声学 residual-VQ codebook,整体下采样倍率为 1920×。
常见说法哪里错了
“Kakao 开源了语音分词器”给人的印象是可自由使用。但事实并非如此:代码采用 Apache-2.0 许可;权重采用 CC BY-NC 4.0 许可——即不得用于商业用途。而且,这一许可并非 Kakao 自行选择。模型卡写明,权重“与训练所用 Emilia 数据集的许可相同”。这一限制从数据出发,经过 checkpoint 传递给了任何下载它的人。
匆忙核查时最容易踩的坑
若向上游追溯核验,情况会更糟。Hugging Face 上的 Emilia 仓库被标记为 cc-by-4.0,但其自身条款将语料库拆分为两部分:Emilia 为 CC-BY-NC,只有 Emilia-YODAS 是 CC-BY。该数据集在机器可读的许可标签上比其实际文本更宽松,而 Kakao 的说明卡采用的是更严格、也是正确的解读。若某团队只看元数据而不是条款来做许可尽调,就会误判为合规,但实际上并非如此。
另外两点更正
这些权重不包含模型代码——必须单独安装 lmspt 包。并且,这也不是新的研究成果:该论文最初是 2025 年 6 月的 arXiv 预印本,如今已发表在 IEEE TASLP 2026 年第 34 卷,第 3714–3727 页。代码仓库的首个提交早于权重发布 12 天。新增的只有权重本身。卡片支持的语言为英语、中文、韩语、德语、法语和日语;辅助语义解码器运行在 16 kHz,而不是 24 kHz。
这对行业意味着什么
几乎所有开源语音-LLM 技术栈都基于那几份被抓取的常见语料训练。如果语料是非商业用途,那么 checkpoint 也同样如此——无论代码仓库看起来多么宽松;而平台上的许可字段也不会提醒你这一点。
