يواجه مطورو أنظمة الذكاء الاصطناعي متعددة الوكلاء تحديًا كبيرًا في تشخيص أسباب الفشل. عندما تفشل هذه الأنظمة في تنفيذ مهمة ما، يضطر المطورون للبحث اليدوي المرهق في سجلات التفاعلات الضخمة لتحديد مصدر المشكلة، وهو عمل استهلاكي للوقت ويتطلب خبرة عميقة بالنظام.
لمعالجة هذه الإشكالية، عكف فريق بحثي من جامعتي بنسلفانيا وديوك، بالتعاون مع معاهد عالمية من بينها Google DeepMind، على تعريف مشكلة جديدة أسموها «نسبة الأخطاء الآلية». تركز المشكلة على تحديد الوكيل المسؤول عن الفشل والخطوة التفاعلية الحاسمة التي أدت إليه. أنتج الفريق مجموعة بيانات معايير تسمى Who&When تضم سجلات فشل مستخرجة من 127 نظام ذكاء اصطناعي، مصحوبة بتعليقات بشرية دقيقة تحدد الوكيل المسؤول والخطوة الخاطئة والتفسير الطبيعي للسبب.
اختبر الباحثون ثلاث طرق للعزو الآلي للأخطاء: الأولى توفر للنموذج الاستفسار كاملًا مع سجل الفشل بالكامل للحصول على إجابة واحدة، والثانية تراجع السجل خطوة بخطوة محاكية الفحص اليدوي، والثالثة تستخدم البحث الثنائي بتقسيم السجل بشكل متكرر. أظهرت التجارب أن أفضل الطرق حققت دقة 53.5 في المئة فقط في تحديد الوكيل المسؤول و14.2 في المئة في تحديد خطوة الخطأ بدقة.
كشفت النتائج أن كل طريقة متخصصة في جوانب مختلفة: الطريقة الأولى أفضل في تحديد الوكيل، بينما الثانية أكثر فعالية في تحديد خطوة الخطأ. كما أظهرت التجارب أن نماذج الاستدلال المتقدمة مثل OpenAI o1 و DeepSeek R1 تواجه صعوبة فيها، مما يؤكد تعقيد المشكلة. كذلك اكتشف الباحثون أن زيادة طول السياق تؤثر سلبًا على أداء جميع الطرق.
نشرت الدراسة كعرض بارز في مؤتمر ICML 2025، وأتاح الباحثون الكود ومجموعة البيانات مفتوحة المصدر للمجتمع العلمي. يرى الفريق أن تطوير هذا النهج الآلي سيحول مهمة تشخيص الأخطاء من عملية غامضة إلى مشكلة قابلة للقياس، مما يسهل تحسين موثوقية أنظمة الذكاء الاصطناعي متعددة الوكلاء.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.