أعلنت DeepMind عن بدء أول عملية تقييم ثنائية العمى لنموذج ذكاء اصطناعي متطور من الفئة الممتازة، مستخدمة بيئة محمية تشفيرياً تمنع تسرب معايير الاختبار للنموذج قبل التقييم. يعاون المشروع معاهد متخصصة منها Singapore AI Safety Institute و OpenMined و AVERI و MLCommons، لرفع مستويات الثقة في نزاهة عملية التقييم.
تشكل هذه الخطوة تطوراً حاسماً في قطاع تقييم الذكاء الاصطناعي، حيث تسعى الشركات والباحثون إلى ضمان أن نتائج الاختبارات تعكس قدرات النماذج الحقيقية بعيداً عن التأثيرات الخارجية. المشكلة التقليدية أن تقييم النماذج المتقدمة تطلبت اختيار بين خيارين محفوفين بالمخاطر: إما كشف بيانات الاختبار الحساسة للشركة المطورة، أو تسليم أوزان النموذج للمقيمين الخارجيين، مما يعرض الملكية الفكرية للخطر.
تستخدم العملية الجديدة تقنية Confidential Space ضمن محفظة Google Cloud للحوسبة الآمنة، وهي تتيح التحقق التشفيري من أن بيانات التقييم الخارجية والنموذج الحاصل على براءة اختراع يبقيان سريين. لا يستطيع المقيمون رؤية أوزان نموذج Gemini، وتبقى بيانات الاختبار محجوبة عن Google، مما يزيل المفاضلة التقليدية بين الأمان والشفافية.
تؤكد DeepMind أنها تجري تقييمات شاملة لأنظمتها عبر مراحل التطوير والنشر، لكنها لا تعتمد على الاختبارات الداخلية وحدها. تتعاون مع مختبرات بحثية متنوعة والمجتمع المدني والمعاهد الحكومية المتخصصة بأمان الذكاء الاصطناعي للكشف عن نقاط الضعف المحتملة.
يتوقع أن يفتح هذا النموذج آفاقاً جديدة في الإشراف على تطور الذكاء الاصطناعي، خاصة في التقييمات الحساسة المتعلقة بالأمن السيبراني والجهات الحكومية، حيث تستطيع المنظمات المستقلة اختبار النماذج المتقدمة دون المساس بسيادة البيانات أو الأمان.
Comments (0)
No comments yet. Be the first.