Kakao는 9월 2일 05:32 UTC에 LM-SPT 음성 토크나이저의 가중치를 Hugging Face에 공개했으며, 초기 공개 커밋은 05:49 UTC, 짝이 되는 코드 저장소는 05:10 UTC에 푸시됐습니다. 이 모델은 24 kHz 오디오를 대상으로 하는 12.5 Hz 신경망 음성 토크나이저로, 8개 코드북을 사용합니다. 이 가운데 하나는 16,384개 항목의 의미론적 코드북이고, 나머지 일곱 개는 4,096개 항목의 음향 잔차 VQ 코드북이며, 다운샘플 비율은 1920×입니다.

흔한 설명이 놓치는 부분

“Kakao가 음성 토크나이저를 오픈소스로 공개했다”는 말은 곧바로 사용 가능하다는 뜻처럼 들립니다. 하지만 코드는 Apache-2.0이고 가중치는 CC BY-NC 4.0입니다. 즉, 상업적 이용은 불가능합니다. 그리고 Kakao가 그 라이선스를 선택한 것도 아닙니다. 모델 카드는 가중치가 “학습에 사용된 Emilia 데이터셋과 동일한 라이선스”를 가진다고 밝힙니다. 이 제한은 데이터에서 체크포인트로, 그리고 이를 내려받는 모든 이용자에게로 이어집니다.

빠르게 확인하는 이들이 빠질 수 있는 함정

상위 출처로 올라가 확인하면 상황은 더 나빠집니다. Hugging Face의 Emilia 저장소는 cc-by-4.0 태그가 붙어 있지만, 자체 약관은 코퍼스를 분리합니다. Emilia는 CC-BY-NC이고, 오직 Emilia-YODAS만 CC-BY입니다. 데이터셋의 기계 판독용 라이선스 태그가 데이터셋의 실제 본문보다 더 허용적인 셈이며, Kakao의 카드는 더 엄격하지만 올바른 해석입니다. 메타데이터만 읽고 라이선스를 점검한 팀이라면 이를 통과시켰을 것이고, 그 판단은 틀렸을 것입니다.

더 작은 두 가지 정정

가중치에는 모델 코드가 포함되지 않았습니다. lmspt 패키지는 별도로 설치해야 합니다. 또한 이는 새로운 연구 결과가 아닙니다. 논문은 2025년 6월의 arXiv 프리프린트이며, 현재는 IEEE TASLP 2026, vol. 34, pp. 3714–3727에 실렸습니다. 코드 저장소의 첫 커밋은 가중치보다 12일 앞섭니다. 새로 공개된 것은 가중치뿐입니다. 카드에 적힌 언어는 영어, 중국어, 한국어, 독일어, 프랑스어, 일본어이며, 보조 의미론 디코더는 24가 아니라 16 kHz로 동작합니다.

이 점이 왜 일반화되는가

대부분의 공개 음성-LLM 스택은 같은 몇 개의 스크랩 코퍼스에서 학습합니다. 코퍼스가 비상업용이면 체크포인트도 비상업용이 됩니다. 코드 저장소가 얼마나 허용적으로 보이든 마찬가지이며, 플랫폼의 라이선스 필드는 이를 경고해 주지 않습니다.