أعلنت جوجل عن إطلاق نموذج Gemini 3.5 Transcribe لتحويل الكلام إلى نصوص بالوقت الفعلي. يأتي النموذج في نسختين منفصلتين: الأولى للملفات المسجلة عبر واجهة Interactions API، والثانية للبث ثنائي الاتجاه عبر Live API. وتُظهر القياسات معدل خطأ كلمات بنسبة 4% للبث المباشر و2.6% للملفات المسجلة.
يدعم النموذج أكثر من 85 لغة بالكشف التلقائي، بما في ذلك التبديل بين اللغات خلال الجملة الواحدة. كما يحقق تحسنًا بنسبة 70% في سرعة إنتاج النصوص النهائية مقارنة بالإصدار السابق Chirp 3. لكن النموذج متاح فقط عبر واجهة برمجية مدارة، دون خيارات للاستضافة الذاتية.
تختلف المميزات بين النسختين اختلافًا جوهريًا. توفر نسخة البث المباشر تحويلًا فوريًا بتأخير أقل من الثانية، مع حد أقصى 10 دقائق للجلسة الواحدة. بينما توفر نسخة الملفات المسجلة ميزات متقدمة كتحديد المتحدثين وإضافة مصطلحات مخصصة، مع إمكانية معالجة ساعة واحدة من الصوت.
يوفر النموذج وضعي تشغيل: الوضع الحرفي الذي يحتفظ بكل محتوى الكلام، والوضع الذكي الذي يزيل التكرارات والأخطاء الكلامية ويحسّن الصيغة النهائية. لكن الوضع الذكي لا يدعم ميزات تحديد المتحدثين وطوابع الزمن على مستوى الكلمة.
تم دمج النموذج بالفعل في منصات عديدة منها LiveKit و Pipecat و Agora، كما يغذي تطبيقات جوجل الاستهلاكية مثل Gemini على macOS وتطبيق Rambler على Android. يُتوقع دعم متصفح Chrome قريبًا.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.