اكتشف فريق بحثي من Hugging Face ظاهرة مقلقة في نماذج التعرف التلقائي على الكلام: أن أكثر الأنظمة أداءً على المعايير القياسية تميل للقيام بسلوك غريب حين تواجه أخطاء في البيانات. أطلق الباحثون على هذه الظاهرة "تحسين المعايير"، وهي تعني أن النماذج تتعلم تكرار الأخطاء الموجودة في قواعد البيانات المشهورة بدلاً من التركيز على الصوت الفعلي.
قام الفريق بتقييم 11 نموذجًا مفتوح المصدر باستخدام ثلاث اختبارات جديدة. في أحد الاختبارات، تم اختبار ما يسمى "اختبار الاتفاق المختلف"، حيث وجدوا أن عدة نماذج عالية الأداء أعادت إنتاج نصوص خاطئة من قواعد بيانات VoxPopuli و LibriSpeech رسميًا حتى عندما تناقضت الأصوات الفعلية هذه الأخطاء. وفي بعض الحالات، بدا أن النماذج تستجيب لإشارات صوتية دقيقة تشير إلى المعيار المحدد الذي يتم اختباره عليه.
في اختبار آخر، قام الباحثون بحذف الأرقام من مقاطع صوتية وطلبوا من النماذج النسخ. وبشكل مفاجئ، أعادت بعض النماذج إنتاج الأرقام المفقودة بدقة، أو حتى توقعت أرقامًا عشوائية، مما يشير إلى أنها تعتمد على أنماط من بيانات التدريب بدلاً من الاستماع الحقيقي. كذلك اختبروا ما إذا كانت النماذج تقلد توافق إملائي معين تستخدمه كل قاعدة بيانات، فوجدوا أن بعضها يحقق دقة تحويل تصل إلى 90 بالمئة.
لكن أهم النتائج جاءت عند اختبار النماذج على بيانات طازجة من نفس المجالات لكن جُمعت بعد انتهاء فترة تدريب النماذج. هنا عادت معظم النماذج للسلوك الأكثر دقة صوتيًا، مما يؤكد أن هذا السلوك المريب مرتبط بخصائص قواعد البيانات المشهورة بالذات. وأشارت الدراسة إلى أن حوالي 40 بالمئة من عينة الاختبار من VoxPopuli تضمنت أخطاء مرجعية محتملة، مما يؤثر على حوالي 3 بالمئة من الكلمات المرجعية إجمالاً.
Comments (0)
No comments yet. Be the first.