AgiBot — وهي Zhiyuan Robotics من شنغهاي — أعلنت في 28 يوليو أن نموذجها متعدد الوسائط الأصلي المجسّد WITA-Omni Preview تصدّر عالميًا لوحة صدارة DailyOmni لفهم omni-modal، محققًا درجة مركبة قدرها 85.21 وفوزًا في ستة من أصل ثمانية مقاييس فرعية. ومن بين النماذج التي تفوّق عليها نماذج من Qwen وGoogle Gemini وByteDance Doubao وNvidia، مع تسجيل الفوارق المعلنة في الفهم الصوتي-المرئي المشترك والاستدلال الزمني.
Thinker, Talker, Actor
الادعاء المعماري هو الجزء الجوهري. فمعظم أنظمة omni-modal تستخدم انقسامًا من نوع Thinker-Talker: أحد المكوّنات يستدل، وآخر يتحدث. وتضيف AgiBot عنصرًا ثالثًا — Actor — بحيث تُنتَج الأفعال الجسدية والتعابير بوصفها مخرجات أساسية إلى جانب الكلام، بدلًا من إلحاق نموذج محادثة بجسم روبوت لاحقًا. وبالنسبة إلى شركة منتجها روبوت لا مساعدًا، فهذه هي النقطة الأساسية.
كيف جرى التدريب
تصف AgiBot استخدام عشرات الملايين من الساعات من البيانات متعددة الوسائط المفتوحة المصدر والملكية الخاصة ضمن خط أنابيب من ثلاث مراحل: الضبط الدقيق الخاضع للإشراف، ثم تقطير المعرفة، ثم تحسين التعلم المعزز.
ما الذي ينقص
تقريبًا كل ما يحتاجه القارئ للتحقق من ذلك. لا عدد للمعلمات، ولا ترخيص، ولا توافر. ولا توجد أوزان على Hugging Face أو GitHub تحت أي من التنظيمين العامّين لـ AgiBot. والنتيجة منقولة عن المختبر ولم تُكرر بصورة مستقلة — وهو التحفّظ المعتاد، لكنه يستحق الذكر بوضوح عندما يكون الادعاء هو الأول عالميًا.
التوقيت
تأتي هذه النتيجة في الأسبوع نفسه الذي منعت فيه FCC الروبوتات البشرية الشكل والرباعية الجديدة المنتجة في الخارج من الحصول على اعتماد المعدات في الولايات المتحدة، وبعد أيام من تصنيف براءات اختراع وضع الشركات الصينية في ست من بين أكثر عشر شركات ناشئة بشرية الشكل ابتكارًا في العالم. وبينما يُستبعد جانب العتاد في الروبوتات الصينية من سوق واحدة، ينشر جانب النماذج لديها انتصارات على مقاييس معيارية.
