كشفت شركة Moonshot AI المطورة لمساعد Kimi الصيني عن معيار جديد يُسمى PerceptionBench، خصيصاً لعزل واختبار قدرات الإدراك البصري البحتة لدى النماذج المتعددة الوسائط بمعزل عن التفكير المنطقي. ويُقسم هذا المعيار الرؤية إلى عشر مهارات فرعية أساسية، لا تتطلب أي منها استدلالاً أو معرفة خارجية، بل تعتمد حصراً على فحص الصورة المتاحة.
أظهرت نتائج تقييم 16 نموذجاً رائدًا أن أعلى نسبة دقة إجمالية لم تتجاوز 59.7 بالمئة، وحققها نموذج GPT-5.6 Sol بفارق ضئيل، تلاه نموذج Kimi K3 بنسبة 58.5 بالمئة، ثم Claude Fable 5 وGemini 3.1 Pro، بينما تراجعت النماذج مفتوحة المصدر مثل Qwen3.5-397B-A17B وGLM-4.6V بفارق ملحوظ.
أوضحت التحليلات أن مشكلة الهلوسة البصرية تُعد أضعف المهارات لجميع النماذج بلا استثناء؛ إذ سجل متصدر القائمة GPT-5.6 Sol نسبة 26.9 بالمئة فقط في هذا القسم. وأكد الباحثون أن العديد من الأخطاء التي تُنسب عادةً إلى عيوب في الاستدلال المنطقي تحدث في الواقع مبكراً أثناء مرحلة قراءة الصور.
تأتي هذه الخطوة امتداداً لأبحاث سابقة للفرق ذاتها مثل معيار WorldVQA واختبار BabyVision، والتي أثبتت تدني أداء النماذج في المهام البصرية الأساسية مقارنة بالبشر، مرجعة ذلك إلى اختناق معلوماتي يحدث أثناء تحويل البيانات المرئية إلى لغة.
يتيح الفريق حالياً مجموعة بيانات المعيار وأكواد التقييم عبر منصة GitHub، في خطوة تهدف إلى مساعدة المطورين على تحديد نقاط الضعف بدقة في قدرات الرؤية الحاسوبية.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.