أعلنت منصة Open ASR Leaderboard عن إضافة مجموعتي بيانات جديدتين باللغة الإنجليزية والهندية بمسمى "Monsoon" للمرة الأولى، مما يمثل دخول لغة هندية إلى لوحة تصنيف تقنيات التعرف على الكلام التي كانت مقصورة على اللغات الأوروبية.
تعكس مجموعات البيانات الجديدة محاولة للتصدي لفجوة حقيقية في معايير التقييم الحالية. الدراسات السابقة أثبتت أن معدلات الخطأ في أنظمة الكلام لا توزع بالتساوي بين جميع المستخدمين، حيث تؤدي أداة واحدة بشكل أسوأ بمرتين تقريباً مع المتحدثين السود مقابل البيض، مع فروقات إضافية حسب النوع والعمر واللهجة. لا تعكس الأرقام الكلية هذا التباين، لأن مجموعات الاختبار التقليدية تسجل ما تم قوله وليس من قاله.
صممت مجموعات "Monsoon" بـ 4888 متحدثاً مع تسجيل 12 خاصية ديموغرافية لكل منهم، متنوعة على تسعة محاور: الموقع الجغرافي والعمر والنوع والمفردات والأجهزة والبيئات الصوتية ونوع الكلام وسرعة النطق وتعدد النسخ الصحيحة. تم جمع البيانات من محادثات عفوية غير مكتوبة على منصة Voice Arena، باستخدام أجهزة المتحدثين الخاصة بهم، مما احتفظ بالبيئات الصوتية الطبيعية والواقعية.
تتميز مجموعات البيانات بتركيز قوي على التنوع الجغرافي والسكاني. تغطي المجموعة الإنجليزية 428 منطقة إدارية موزعة على 30 ولاية وإقليم، بينما تغطي المجموعات الهندية 202 و295 منطقة. لا يتجاوز أي جهاز واحد 2.1% من الشرائح، مما يمنع الإفراط في التخصص بنظام صوتي واحد. تم إطلاق المجموعات بشكل علني للاختبار الذاتي وعرض خاص محتجز لتحديد المعايير.
أخضعت المنصة كل التسجيلات لعمليات تحكم جودة صارمة قبل نسخها: التحقق من اللغة باستخدام نماذج تحديد اللغة، تأكيد نوع المتحدث ببيانات ذاتية، الكشف عن الصوت المسجل مسبقاً، وقياس نسبة الإشارة إلى الضوضاء. يمكن لتحليل من هذا النوع كشف معدلات خطأ مختلفة بشكل كبير حسب المنطقة والجهاز والنوع والعمر وغيرها على لوحة تصنيف علنية.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.