نشرت Kakao أوزان tokenizer الكلام LM-SPT على Hugging Face في 2 سبتمبر عند 05:32 UTC، مع commit الإصدار الأول عند 05:49 UTC، فيما دُفع مستودع الشفرة المقترن عند 05:10 UTC. النموذج هو tokenizer كلام عصبي بمعدل 12.5 Hz فوق صوت 24 kHz مع 8 codebooks — codebook دلالي واحد يضم 16,384 مدخلاً، إضافة إلى سبعة codebooks تكميلية acoustic residual-VQ تضم 4,096 مدخلاً، عند خفض بمقدار 1920×.

ما الذي يخطئ فيه الإطار الشائع

القول إن “Kakao تطرح tokenizer كلام مفتوح المصدر” يوحي بإمكانية الاستخدام. الشفرة مرخّصة Apache-2.0؛ أما الأوزان فمرخّصة CC BY-NC 4.0 — أي لا استخدام تجاري. ولم تختر Kakao هذه الرخصة. وتذكر بطاقة النموذج أن الأوزان تحمل “الرخصة نفسها لمجموعة بيانات Emilia المستخدمة في التدريب”. تنتقل القيود من البيانات، إلى checkpoint، إلى كل من يحمّله.

الفخ لمن يراجع بسرعة

وعند الرجوع إلى المصدر للتحقق، تصبح الصورة أسوأ. مستودع Emilia على Hugging Face مُوسوم بـ cc-by-4.0، لكن شروطه نفسها تقسم corpus: Emilia هي CC-BY-NC، وEmilia-YODAS فقط هي CC-BY. ووسم الرخصة القابل للقراءة آلياً في مجموعة البيانات أكثر تساهلاً من النص الفعلي للمجموعة، بينما تعكس بطاقة Kakao القراءة الأشد صرامة والصحيحة. أي فريق يدقق في الرخص عبر metadata بدل الشروط سيعتبر ذلك مقبولاً، وسيكون مخطئاً.

تصحيحان أصغر

تُشحن الأوزان من دون شفرة النموذج — إذ يجب تثبيت حزمة lmspt بشكل منفصل. وليس هذا نتيجة بحثية جديدة: فالورقة هي preprint على arXiv من يونيو 2025، ونُشرت الآن في IEEE TASLP 2026، المجلد 34، الصفحات 3714–3727. وسبق أول commit في مستودع الشفرة نشر الأوزان بـ 12 يوماً. الجديد الوحيد هو الأوزان. لغات البطاقة هي الإنجليزية والصينية والكورية والألمانية والفرنسية واليابانية؛ أما المفكك الدلالي المساعد فيعمل عند 16 kHz، لا 24.

لماذا يتجاوز ذلك هذه الحالة

تقريباً كل حزمة open speech-LLM تُدرَّب على مجموعة صغيرة من corpora الممسوحة ضوئياً نفسها. وإذا كانت المجموعة غير تجارية، فسيكون checkpoint كذلك، بغضّ النظر عن مدى تساهل مستودع الشفرة — وحقول الرخصة في المنصة لن تنبّهك إلى ذلك.