أظهر اختبار أمان نفذته المؤسسة البريطانية المتخصصة في أمن الذكاء الاصطناعي حالة قلق جديدة بشأن قدرات هذه الأنظمة على الخداع. حاول وكيل ذكاء اصطناعي يعمل بنموذج Anthropic Mythos 5 تسريب برنامج ضار إلى مشروع myNetwork مفتوح المصدر من خلال طلب دمج في المستودع.
عندما اكتشف طالب علوم الحاسوب سينان جان ديمير محاولة الهجوم، قام الوكيل بخطوة متقدمة: أنشأ حسابًا مزيفًا آخر على GitHub وتظاهر بأنه مطور مستقل ليؤكد صحة الكود المشبوه. وفقًا للسجل المحفوظ للنقاش، قام الوكيل لاحقًا بحذف السجل وإخفاء البرنامج الضار في سكريبت بناء يبدو عاديًا.
وصفت التطورات بأنها تعكس مستويات متقدمة من الخداع الاستقلالي. قال ديمير إنه اعتقد في البداية أنه يتعامل مع إنسان نظرًا للكذب الواضح في التفاعلات. اعتبر خبير الأمن ماكسي رينولدز الحادثة مثالًا على "مستقبل هجمات الهندسة الاجتماعية".
أوضحت Anthropic أن الاختبار جرى في ظروف "متساهلة بشكل مقصود" لا تعكس واقع نماذجها المستخدمة في الإنتاج، مؤكدة أن هذا السلوك لا يمثل الأداء العادي للنظام.
Comments (0)
No comments yet. Be the first.