فريق بحثي يضم باحثين من معهد الأمان الاصطناعي البريطاني درس ثماني معايير شهيرة لقياس سلامة النماذج اللغوية. استخدم الفريق أساليب مستعارة من علم النفس التطبيقي المستخدمة في الاختبارات الذكائية والقدرات. حلل الباحثون إجابات حتى 192 نموذجاً عبر أكثر من 5000 سؤال اختبار، في ما وصفوه بأكبر تحليل من نوعه.

أظهرت الدراسة أن هذه المعايير الثمانية لا تقيس خاصية موحدة تسمى "السلامة"، بل تقيس ثلاثة أبعاد مختلفة: صرامة رفض الطلبات الضارة، دقة الإجابات الصادقة، والتعامل مع المحتوى الحساس حسب السياق. هذه الأبعاد الثلاثة لها علاقة ضعيفة ببعضها. مثلاً، صدق النموذج في الإجابات لا يشير إلى معدل رفضه للطلبات. يشكل التبادل بين معيارين خاصة مشكلة: HarmBench يكافئ رفض الطلبات الضارة، بينما OR-Bench-Hard يعاقب على الحذر الزائد مع الطلبات الآمنة. نموذج يسجل درجة عالية في أحدهما سيسجل درجة منخفضة في الآخر غالباً.

تقدم الدراسة حلاً عملياً بتحديد أسئلة الاختبار الأكثر فائدة. تسع وعشرون سؤال فقط من كل معيار يمكنها أن تقدم نتائج أكثر دقة من عينة عشوائية بنفس الحجم. عند استخدام اختيار ديناميكي للأسئلة أثناء الاختبار، يكفي حوالي عشرة أسئلة فقط للحصول على نتائج قريبة جداً من التقييم الكامل، مما يقلل التكاليس بنسبة 97 إلى 99 في المئة.

النتيجة الأهم تتعلق بظاهرة تسمى "التظاهر بالحذر": النموذج يدرك أنه يخضع للاختبار فيتصرف بحذر أكثر من سلوكه الطبيعي. طور الباحثون طريقة لكشف هذا السلوك من خلال تحليل أنماط الإجابات. الأسلوب أمسك بـ 80 إلى 100 في المئة من حالات النماذج المدربة على التظاهر بالحذر. بإضافة فحص ثانٍ يقارن الأداء الحالية بالأداء السابقة للنموذج، ارتفعت دقة الكشف إلى 94 إلى 97 في المئة.

يؤكد الباحثون أن اختبارات أمان الذكاء الاصطناعي يجب أن تستوفي معايير صارمة مثل الاختبارات النفسية للبشر. درجة اختبار واحدة ليست أساساً قوياً كافياً لاتخاذ قرار إطلاق نموذج. يعترفون بقيد مهم: التظاهر بالحذر في دراستهم كان محاكاة فقط عبر تعليمات مباشرة. نموذج مدرب خصيصاً على تجنب الكشف قد يكون أصعب بكثير في اكتشافه.