جوجل تطلق ميزة “Agentic Video” في نماذج Gemini لمعالجة الفيديوهات بأقل تكلفة

جوجل تطلق ميزة “Agentic Video” في نماذج Gemini لمعالجة الفيديوهات بأقل تكلفة
ميزة معالحة الفيديوهات الجديدة من Gemini

أعلنت شركة جوجل بالتعاون مع مختبر أبحاثها Google DeepMind عن إطلاق ميزة جديدة تحمل اسم “الفهم الوكيل للفيديو” (Agentic Video Understanding) ضمن عائلة نماذج Gemini، وتهدف هذه الميزة إلى تحليل مقاطع الفيديو بطريقة تفاعلية ذكية.

وهذه الخطوة التى أعلنت جوجل عبر مدونة Blog Google أحدثت نقلة كبيرة في كفاءة المعالجة، ويمكن لها خفض استهلاك الرموز (Tokens) بنسبة تصل إلى 88%، وتقليص تكاليف التحليل بنسبة تصل إلى 66%، مع تحسين دقة الإجابات بنسبة تصل إلى 7%، وهو بكل تأكيد ما يحل معضلة التكلفة الباهظة وفقدان التفاصيل في المقاطع الطويلة.


كيف تعمل ميزة Gemini لمعالجة الفيديوهات بأقل تكلفة

وجب الإشارة بأن النماذج في السابق كانت تعتمد على “المعالجة الثابتة” (Static Processing)، والتي تقوم بسحب إطارات الفيديو بمعدل زمني محدد وثابت داخل إطار واحد في الثانية – 1 FPS وإدخال الفيديو بالكامل مرة واحدة.

وهذه الطريقة كانت تؤدي لإستهلاك هائل للرموز في الفيديوهات التي تمتد من دقائق معدودة إلى عدة ساعات، وكانت أيضاً تتسبب في تفويت اللحظات السريعة جداً التي تحدث في أجزاء من الثانية.

ولكن ومع ميزة Agentic Video Understanding، أصبح نموذج جيميني يتصرف مثل “وكيل ذكي”:

  • حيثُ يحدد النموذج اللحظات المرتبطة بسؤال المستخدم ويبحث عبر الإطارات المرئية، والمقاطع الصوتية، والنصوص المكتوبة (Transcripts).
  • وبدلاً من مسح مقاطع الفيديو بكثافة واحدة، حيثُ يركز النموذج قدراته الحسابية ويعيد فحص المقاطع الهامة بمعدل إطارات ديناميكي (Dynamic FPS) ودقة أعلى للتحقق من تفاصيل دقيقة وسريعة، دون هدر الموارد على المشاهد الثابتة أو غير المهمة

مزايا ميزة “Agentic Video” في نماذج Gemini لمعالج الفيديوهات

يمكن للنموذج التعرف على أدق التغيرات اللحظية ونقاط الانتقال السريعة بين المشاهد، مما يساعد في عمليات تحرير ومونتاج الفيديو المؤتمتة باحترافية عالية دون تفويت أي لقطة خاطفة.

كما يمكن للنظام أيضاً العثور على إجابات لأسئلة شديدة التحديد داخل التسجيلات الممتدة لساعات، مثل المحاضرات الطويلة أو تسجيلات المراقبة، وذلك بأقل استهلاك ممكن للرموز وبكفاءة تشبه العثور على “إبرة في كومة قش”.

وبالتالي وعند ملاحظة أي نشاط غير معتاد أو حركة مفاجئة، يقوم النموذج برفع معدل التقاط الإطارات تلقائياً لهذا الجزء بالذات، مما يتيح فحص المشهد بتفاصيل بصرية فائقة الوضوح.

وتتيح الميزة تعقب وتعداد العناصر المتحركة أو تكرار التمارين الرياضية والنشاطات الفيزيائية السريعة بدقة، متجاوزة قيود الفحص التقليدي البطيء.


النماذج المدعومة لميزة معالجة الفيديوهات “Agentic Video” في نماذج Gemini

الجدير بالذكر أن شركة جوجل تُتيح هذه المزايا الحديثة، على أحدث نماذجها الحالية للذكاء الأصطناعي، وهي كالتالي:

  • Gemini 3.7 Flash: حيثُ يقدم هذا النموذج أفضل أداء وجودة إجمالية وتوازن مثالث يجمع ما بين التكلفة والدقة.
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash-Lite

الجدير بالذكر أن هذه الميزة أصبحت أيضاً متاحة للمطورين عبر واجهة Gemini API في كل من منصة Google AI Studio ومنصة Gemini Enterprise Agent Platform، وتدعم ملفات الفيديو المرفوعة ومقاطع يوتيوب مباشرة.

وهذه الميزة تعمل بنفس سعر الرسوم الخاصة بالإشتراكات الحالية بدون أي رسوم إضافية عند تفعيلها داخل نماذج جيميني المختلفة، وأوضحت جوجل بأن المعالجة الثابتة التقليدية ستظل خياراً متاحاً للمقاطع القصيرة جداً (أقل من 5 دقائق) عند الحاجة إلى سرعة استجابة فورية.

ومن المقرر أن تصل ميزة معالجة الفيديو إلى تطبيق Gemini قريباً لجميع المستخدمين، كما سيتم دمجها خلال الأشهر القادمة في خدمة “Ask YouTube” داخل صفحات مشاهدة يوتيوب، لتمكين المستخدمين من طرح أسئلة حول محتوى الفيديو والحصول على إجابات مدعومة بالتفاصيل المرئية الدقيقة.