أظهرت دراسة عشوائية شملت أكثر من ألف طالب جديد في جامعة بوكوني أن نموذج GPT-4o ساهم في رفع درجاتهم بشكل كبير في المهام الإدارية. قسّم الباحثون الطلاب إلى مجموعات متعددة: مجموعة ضابطة، ومجموعة تلقت دروسًا في التفكير السببي، وأخرى حصلت على إمكانية الوصول للنموذج، وأخيرة جمعت بين النهجين.

حقق الطلاب الذين استخدموا GPT-4o نقاطًا أعلى بمعدل درجة كاملة تقريبًا على مقياس من خمس درجات. كانت إجاباتهم تتضمن أفكارًا أكثر بمتوسط نقطتين، وتتسم بتماسك منطقي أقوى، وتطابقًا أفضل مع توصيات الخبراء. لكن الدراسة لم تتضمن اختبارًا لاحقًا يقيس فهم الطلاب الفعلي دون الاعتماد على الأدوات الذكية.

الملفت أن نظم التقييم الحالية تكافئ الإجابات المنظمة والمتوافقة مع الحل المتوقع، بينما تعاقب الأصالة والتفكير العميق. درس الباحثون تأثير دروس التفكير السببي فوجدوا أنها لم ترفع الدرجات التقليدية لكنها شجعت الطلاب على تنويع أفكارهم والتعمق في التحليل.

أبحاث سابقة أوضحت نمطًا مقلقًا: عندما يستخدم الطلاب الذكاء الاصطناعي لاستبدال تفكيرهم بدلاً من تعزيزه، ينخفض أدائهم بشدة. دراسة شملت أكثر من 500 ألف درجة جامعية أمريكية أظهرت أن الطلاب الذين ألغيت لهم إمكانية الوصول للأدوات الذكية حققوا نتائج أسوأ بمعدل 18 إلى 24 بالمئة على المدى الطويل.

تشير هذه النتائج إلى تحديٍ أساسي في التعليم الحديث: فجوة متسعة بين تحسن الدرجات وتحقق التعلم الفعلي. يرى الباحثون أن إصلاح معايير التقييم ليشمل الأصالة والتفكير النقدي ضرورة ملحة، لكن ذلك قد يتطلب إعادة تشكيل النظام التعليمي برمته.