أعلنت Google عن إطلاق ميزة فهم الفيديو الموجهة بالأهداف في نماذج Gemini 3.7 Flash و3.6 Flash و3.5 Flash-Lite. تتيح هذه الميزة للنموذج المسح الديناميكي لأجزاء الفيديو، مما يحسّن دقة التحليل بينما يخفض استهلاك الرموز إلى 88% والتكاليف إلى 66%. يمكن للمطورين تفعيل الميزة اليوم من خلال ضبط إعدادات واجهة برمجية البرنامج على "agentic" في Google AI Studio أو منصة Gemini Enterprise Agent Platform.
تعتمد الميزة على دمج أدوات الفيديو الأصلية مع قدرات النموذج في المنطق، بحيث تقوم بالبحث والمسح الديناميكي لأجزاء الفيديو المستهدفة عبر الإطارات المرئية والصوت والنصوص المكتوبة. بخلاف المعالجة الثابتة التقليدية التي تستخدم معدل إطارات محدد مسبقاً، تمكّن هذه الميزة النموذج من تحديد ما يجب مشاهدته وبأي سرعة وأي وسيط استخدام، مما يقلل من استهلاك الموارد بشكل كبير.
تظهر التحسينات بشكل ملحوظ في معالجة الفيديوهات الطويلة، من دروس الشرح التي تمتد لعشر دقائق وحتى المحاضرات التي تستغرق ساعة ونصف والتسجيلات متعددة الساعات. في السابق، اضطر المطورون للاختيار بين تكاليف رموز عالية أو تقنيات تحذف التفاصيل الحاسمة.
حققت Gemini 3.7 Flash أفضل أداء شامل عند استخدام هذه الميزة، مما وضعها على حدود الكفاءة الأمثلية بين الدقة والتكلفة مقارنة بالنماذج الأخرى المختبرة. الميزة متاحة الآن للفيديوهات المرفوعة ومقاطع YouTube عبر واجهة برمجة البيانات في Google AI Studio ومنصة Gemini Enterprise Agent Platform، وتستخدم التسعير المعياري دون رسوم إضافية.
ستتوفر الميزة قريباً لجميع مستخدمي تطبيق Gemini عبر نماذج Flash و Flash-Lite. كما ستعمل الميزة قريباً على تحسين ميزة "Ask YouTube" على صفحة مشاهدة الفيديو، حيث ستستخدم Gemini لتقديم إجابات عالية الجودة مدعومة بالمحتوى البصري.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.