أطلقت Google Gemini Omni 1.1 Flash للمطورين في 27 أغسطس عند 16:00 UTC، مضيفةً توسيع المشاهد، والاستيفاء بين الإطارين الأول والأخير، ووضع مسودة منخفض التكلفة، وتهيئة مرجعية للفيديو. وتصف الوثائق gemini-omni-1.1-flash بأنه "نموذج متعدد الوسائط عالي الأداء صُمم لتوليد الفيديو السريع، والتحرير، والتحكم السينمائي." وهو متاح مباشرة في Google AI Studio وGemini API وGemini Enterprise Agent Platform وGoogle Flow، مع وصول توسيع المشاهد إلى مشتركي AI Plus وPro وUltra في تطبيق Gemini عالميًا.
ما الجديد فعليًا
يضيف توسيع المشاهد حتى 10 ثوانٍ لكل جولة، وصولًا إلى حد أقصى إجمالي معلن يبلغ 40 ثانية. ويقبل الفيديو المرجعي حتى ثلاث ثوانٍ من لقطات موجودة للحفاظ على اتساق شخصية أو بيئة. ونسب الأبعاد هي 16:9 افتراضيًا و9:16. كما أن وضع علامة SynthID المائية مدمج. وتُذكر Adobe Firefly وFigma Weave وRunway بوصفها مستخدمين في الإنتاج؛ ويقول المدير الإبداعي في Figma Weave إن النموذج "ينقل الفرق إلى ما هو أبعد من توليد الفيديوهات إلى الإخراج الحقيقي لها".
ما يخطئ فيه الإطار الشائع
تنتشر ثلاث ادعاءات تتناقض مع صفحات Google نفسها. أولًا، إن "توليد فيديو 4K" هو مرحلة لاحقة بعد المعالجة: إذ تشير بطاقة النموذج إلى أن 4K و1080p كلاهما يجريان رفعهما، بينما يتوقف التوليد الأصلي عند 720p — و360p في وضع المسودة. ثانيًا، إن "فيديوهات مدتها 40 ثانية" تخلط بين سقف وحدّة توليد. فالـ40 ثانية لا تتحقق إلا عبر تكديس جولات 10 ثوانٍ إلى نهاية المقطع؛ ولا يستطيع النموذج إنتاج 40 ثانية دفعة واحدة ولا إدراجها في الوسط. ثالثًا، إن "أسرع بنسبة 60% وأقل تكلفة بثلث" ينطبق على مسار المسودة 360p وحده — أي إنه خصم متعلق بالدقة يُقرأ على أنه مكسب في الكفاءة.
جاهز للإنتاج في مكان، ومعاينة في مكان آخر
تقدّم التدوينة الإطلاق بوصفه جاهزًا للإنتاج. لكن صفحة وثائق Google Cloud للنسخة المؤسسية تحمل عنوان "Gemini Omni 1.1 Flash Preview". إن واجهة الإتاحة ومرحلة الإطلاق ليستا الشيء نفسه عبر قنوات Google الثلاث، وقد قامت التغطية بدمجهما في شيء واحد.
الحدّ الجغرافي الذي لم يُنقل
إن توسيع فيديو مرفوع مع إضافة حوار غير متاح في EEA وسويسرا والمملكة المتحدة. كما أن تحرير الصوت غير مدعوم في أي مكان. ولا يظهر أيٌّ من هذين القيدين في معظم المواد المنشورة.
