أطلقت شركة جوجل عبر فريق DeepMind نموذج "جيميني 3.5 ترانسكرايب" للتعرف على الكلام وتحويله إلى نصوص مكتوبة. يتميز النموذج الجديد بقدرته على التعامل مع الضوضاء الخلفية والمصطلحات المعقدة والكلام غير الطلق، حيث يحول الصوت الخام مباشرة إلى نصوص منسقة وسليمة.
يتفوق النموذج على إصدار "Chirp 3" السابق من حيث معدل الأخطاء اللفظية وسرعة المعالجة. وفقًا لقياسات Artificial Analysis، تحسنت سرعة النسخ النهائي بنسبة 70%. كما حقق الأداء العالية في اختبار FLEURS على مجموعة من اللغات الرئيسية، بمعدل خطأ 5.50% في الوضع المباشر و5.04% في الأوضاع غير المباشرة.
يدعم النموذج الترجمة الفورية بين اللغات والنسخ المتدفق بسلاسة، إلى جانب تحديد المتحدثين المتعددين وعلامات الوقت على مستوى الكلمات. يمكنه أيضًا تنظيف الكلام من الفراغات والكلمات الحشو، والاستفادة من سياق الشاشة لضمان دقة عالية.
أتاحت جوجل النموذج للمطورين عبر Google AI Studio وGemini Enterprise Agent Platform، ويدعمه عدد من منصات تطوير التطبيقات مثل Agora و Fishjam و LangChain و LiveKit و Pipecat و Vercel. كما أبدت شركات مثل vivo و Intellitek Health و Lingopal ملاحظاتها الإيجابية حول دقة النموذج وسرعته ودعمه للغات المتعددة.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.