أظهرت دراسة جديدة أن نماذج الذكاء الاصطناعي الكبرى تحتفظ بقدرات متقدمة في كتابة النصوص وحل المشاكل المعقدة، إلا أنها تواجه صعوبة حقيقية في مهمة يؤديها الإنسان بسهولة يومية: الحفاظ على التركيز وسط المشتتات. أجرى باحثون بقيادة سوكيتو باتيل اختبارًا نفسيًا معروفًا يدعى اختبار ستروب على عدة نماذج ذكاء اصطناعي رائدة، وكشفت النتائج اختلافًا جوهريًا بين معالجة هذه الأنظمة للمعلومات وكيفية إدارة الدماغ البشري للانتباه.

يتطلب اختبار ستروب من المشارك تسمية لون الحبر الذي طُبعت به كلمات ألوان، بدلًا من قراءة الكلمة نفسها. الاختبار بسيط ظاهريًا لكنه يفرض تحديًا كبيرًا لأن قراءة الكلمات عادة تلقائية راسخة لدى الإنسان، مما يتطلب من الدماغ كبح جماح هذا الميل والتركيز على تحديد لون الحبر فقط.

كشفت التجارب أن نماذج GPT-4o و Claude 3.5 Sonnet و GPT-5 و Gemini 2.5 حققت دقة عالية عند التعامل مع قوائم قصيرة من الكلمات. لكن الأداء انهار بسرعة مع زيادة الطول. حققت GPT-4o دقة بنسبة 91 في المئة مع خمس كلمات، ثم انخفضت إلى 57 في المئة مع عشر كلمات، وهبطت إلى 15 في المئة فقط مع أربعين كلمة. شهدت Claude 3.5 Sonnet أداءً مستقرًا حتى عشرين كلمة، ثم انخفضت إلى 24 في المئة مع أربعين كلمة.

حسب الباحثين، فشلت الأنموذجات في الحفاظ على التعليمات المتعلقة بتحديد الألوان وبدأت بدلًا من ذلك بقراءة الكلمات نفسها. بعبارة أخرى، بدت الأنظمة غير قادرة على كبح الاستجابة التي تدربت عليها أكثر من غيرها. هذا يميز نقطة فاصلة بين الذكاء البشري والاصطناعي، إذ يتمتع البشر بقدرة على الحفاظ على التركيز على هدف محدد مع تصفية المعلومات المتنافسة، بينما تعاني نماذج الذكاء الاصطناعي من قيود جوهرية في هذا النوع من التحكم المعرفي خاصة عندما تصبح المهام أكثر صعوبة وطولًا.