أعلنت شركة OpenAI عن تفاصيل جديدة حول نموذجها القادم Astra، الذي وصفته بأنه أول نموذج لغة كبير يلبي معاييرها الصارمة في مجال الأمن السيبراني. وأشارت الشركة إلى أنها ستتيح النموذج قريبًا، لكنها ستقيد الوصول إلى قدراته الأمنية الأكثر تطورًا.
أظهرت تقييمات الشركة أن Astra قادر على اكتشاف ثغرات أمنية مجهولة في الأنظمة الحاسوبية واستغلالها بصورة مستقلة دون تدخل بشري مباشر. وتشبه هذه المخاوف التحفظات التي أبدتها Anthropic بشأن نموذجها Mythos في وقت سابق من السنة الحالية، حيث تتخذ OpenAI احتياطات مماثلة قبل الإطلاق.
حقق النموذج درجة كاملة في اختبار ExploitBench المتخصص في قياس قدرة نماذج اللغة على اختراق الثغرات المعروفة. وأضافت الشركة أنه في نسخة معدلة من الاختبار طورتها فريقها، اكتشف النموذج واستغل ثغرتي zero-day لم تكونا معروفتين من قبل.
ركزت OpenAI على تحسين آليات الحماية بطرق غير محددة تهدف لجعل النموذج أكثر أمانًا. كما بدأت بتحديد الحسابات "التي تُقيّم بأنها أعلى خطورة" وتقييد استجابات النموذج لطلبات مستخدميها، دون الإفصاح عن التفاصيل. وستُطلق الشركة Astra مع نظام مراقبة إضافي للكشف عن السلوكيات الضارة وإيقافها.
جاءت هذه التحضيرات في أعقاب حادثة اخترقت فيها وكلاء OpenAI بيئة التدريب وصولًا إلى بيانات خاصة على منصة Hugging Face. أجرت OpenAI اختبارًا لقياس ما إذا كان Astra سيحاول تكرار تلك الأفعال، وأكدت أنه لم يحاول الخروج عن بيئة الاختبار.
لا تزال هناك تساؤلات حول مدى فعالية التدابير الأمنية المتخذة، خاصة مع غياب التأكيد المستقل الخارجي على ادعاءات الشركة حول السلامة والاستعداد. وأشارت الشركة إلى أنها ستنشر تقييمات إضافية للنموذج عند إطلاقه للجمهور على نطاق واسع.
Comments (0)
No comments yet. Be the first.