قدّمت Google في 1 سبتمبر ميزة فهم الفيديو بأسلوب agentic لـ Gemini، وقالت إنها تخفض تكاليف التحليل بما يصل إلى 66% واستهلاك الرموز بما يصل إلى 88%، مع تحسين الدقة بما يصل إلى 7%. وتُفعَّل هذه الميزة عبر ضبط المعالجة على agentic في إعدادات واجهة البرمجة، مع تسعير رموز Gemini API القياسي من دون رسوم إضافية على الميزة.
ما الذي يخطئ فيه التناول الشائع
تبدو نسبة الخفض البالغة 88% في الرموز وكأنها اختراق في الضغط داخل النموذج. لكنها ليست كذلك. يتيح النمط agentic لـ Gemini أن يختار أي اللحظات يستدعي، وبأي معدل إطارات، وما إذا كان سيستخدم الإطارات أو الصوت أو النص التفريغي، بدلًا من أخذ عينات الإطارات الثابتة بالمعدل القديم. وبذلك يشاهد النموذج جزءًا أقل من الفيديو. وهذه قدرة حقيقية ومفيدة، لكنها تظل محدودة بحكم النموذج نفسه على ما يمكن تجاوزه: فإذا كانت الأدلة ذات الصلة موزعة على نحو رقيق عبر زمن التشغيل كله، فلن يبقى ما يمكن تخطيه، ويتلاشى التوفير.
الفجوة بين رقمين
لاحظ أن التوفير في التكلفة (66%) أقل بكثير من التوفير في الرموز (88%). والفرق يعود إلى الحلقة agentic نفسها — فقرار ما ينبغي النظر إليه يستهلك رموزًا أيضًا. وجميع الأرقام الثلاثة بصيغة “بما يصل إلى”، ما يجعلها حدودًا قصوى لا توقعات.
أين يعمل فعليًا
الخطأ التفسيري الثاني يتعلق بالتوزيع. فقد أُطلقت هذه الميزة على سلسلة Flash فقط — Gemini 3.7 Flash و3.6 Flash و3.5 Flash-Lite — وعبر Gemini API فقط في Google AI Studio وGemini Enterprise Agent Platform. أما تطبيق Gemini فسيحصل عليها “قريبًا”، وميزة YouTube “Ask YouTube” ستكون في “الأشهر المقبلة”. وقد استُخدم التطبيق الاستهلاكي في معظم التغطيات لتوضيح الإطلاق، رغم أنه لا يضم الميزة.
لماذا خيار التسعير هو الإشارة الأهم
تقول Google إن Gemini 3.7 Flash “يحقق أفضلية باريتو بين الدقة والتكلفة بين النماذج المختبرة”، وهي لا تفرض أي تكلفة إضافية على النمط. وكان الفيديو المجال الذي توقف فيه طول السياق عن أن يكون مهمًا، لأن معدل الإطارات الثابت يجعل التكلفة تتناسب مع زمن التشغيل لا مع كثافة المعلومات. إن كسر هذا الارتباط ثم الامتناع عن تسعيره بشكل منفصل هو محاولة لجعل تحليل الفيديو الطويل عبئًا عملًا افتراضيًا لا تخصصيًا.
