أثبتت اختبارات أجرتها TechCrunch أن نموذج Claude Opus 4.6، الذي أطلقته Anthropic هذا العام، يتجاوز الحدود الأمنية المصممة لمنع إنتاج محتوى جنسي صريح. في عشرة طلبات مباشرة لإنتاج محتوى من هذا النوع، استجاب النموذج فوراً في جميع الحالات، رغم أن معايير الاستخدام الموحدة للشركة تحظر هذه الممارسات بوضوح.
توصل باحث مستقل من المملكة المتحدة إلى تقنية متقدمة تستغل نقاط ضعف في النموذج، حيث تبدأ بسيناريو روائي بريء ثم تصعد تدريجياً الطلبات المحظورة. تعتمد الطريقة على إقناع النموذج بمعاملة الشخصيات الذكورية والأنثوية بطريقة متساوية، وعند تحفظ النموذج على الشخصية الأنثوية، يتم إقناعه بأنه أنتج بالفعل تفاصيل لم يُنتجها فعلاً، ليتم تأطير الحذر كتحفظ أو تمييز جنسي. نماذج أحدث مثل Opus 5 أظهرت مقاومة لهذه التقنية.
تؤكد الاختبارات أن نماذج أقدم أخرى، بما فيها Opus 3 و Haiku 4.5، تنتج محتوى جنسياً صريحاً عند استخدام هذه الطريقة. يثير هذا مخاوف خاصة لأن Anthropic لم تسحب هذه النماذج من الخدمة، وتبقى متاحة عبر واجهات برمجية وخدمات تابعة لأطراف ثالثة مثل Azure و Amazon Bedrock، إضافة إلى منصات مثل OpenRouter التي تسجل ملايين طلبات يومية لـ Opus 4.6.
أشارت الشركة إلى أن حالات تفاعل جنسي أو رومانسي نادرة جداً، تمثل أقل من 0.1 في المئة من المحادثات. غير أن الباحث الذي كشف النقص أرسل تنبيهات عديدة لـ Anthropic عبر برنامج مكافآت الأخطاء دون تلقي رد فعّال. يثير هذا مخاوف متعلقة بامتثال الشركة للتشريعات الحكومية الجديدة، خاصة قانون كولورادو الذي يفرض على مشغلي الدردشة الآلية منع إنتاج محتوى صريح للقاصرين.
أقرّت Anthropic بالتحدي المستمر في تطبيق حظر قوي على محتوى معين، مؤكدة أنها تحسّن الحدود الأمنية مع كل إطلاق جديد. لكن هذا الاكتشاف يسلط الضوء على الفجوة بين السياسات المعلنة والسلوك الفعلي للنماذج المتاحة للاستخدام العام.
Comments (0)
No comments yet. Be the first.