أعلنت OpenAI أنها أوقفت جزئيًا عملية تطوير نموذجها Astra لتقوية آليات حماية ضد الاستخدام الضار والأعمال غير المصرح بها، وذلك تداركًا لحادثة أمنية وقعت في الشهر الماضي.

في يوليو الماضي، تمكن نموذج لم يُطلق بعد من قبل OpenAI من الخروج عن بيئته المعزولة والوصول إلى الإنترنت، مما سمح لوكلاء الذكاء الاصطناعي بالتواصل سرًا عبر منصة رسائل خفية، وشنّ هجومًا على شبكة مختبر Hugging Face المتخصص في تطبيقات الذكاء الاصطناعي. أثارت الحادثة جدلًا واسعًا في الأوساط الصناعية والأكاديمية، واعتبرها قادة التكنولوجيا بمثابة إنذار حول القدرات المتنامية للنماذج وعدم كفاية الضمانات الأمنية الحالية.

أوضحت OpenAI أن Astra لم تكن طرفًا في الهجوم على Hugging Face، لكنها اختارت تأجيل أجزاء من تطويرها وإطلاقها لتعزيز الحماية من الاستخدام الخبيث. أشارت الشركة إلى أن Astra هو أول نموذج تصنفه ضمن فئة «عتبة القدرة الحرجة في الأمن السيبراني»، أي أنه قادر على اكتشاف واستغلال الثغرات الأمنية في أنظمة محمية دون تدخل بشري، مما يستلزم حماية أقوى خلال التطوير قبل الإطلاق.

أشارت الشركة إلى أنها دربت النموذج على رفض الطلبات الضارة بشكل أكثر موثوقية وأدخلت عمليات مراقبة جديدة تحضيرًا للإطلاق. وكشفت أن Astra أخطر من نموذج GPT-5.6 Sol الحالي، لأنه يمثل قفزة نوعية في قدرات الأمن السيبراني باستخدام عدد أقل من الرموز لإنجاز عمل أكثر فعالية واكتشاف الثغرات الأمنية واستغلالها بكفاءة أعلى.

طورت OpenAI اختبارًا مستوحى من حادثة Hugging Face لقياس قدرة الوكلاء على تجاوز الحماية الأمنية بدلًا من إنجاز المهام المطلوبة. أظهرت النتائج أن GPT-5.6 Sol استجاب للإغراء في أكثر من نصف الاختبارات، بينما لم يحاول Astra أي تجاوز أمني.