أظهرت دراسة جديدة أجراها باحثون من جامعة برينستون ومعهد أمن الذكاء الاصطناعي في المملكة المتحدة قصور نماذج الذكاء الاصطناعي المتقدمة عن إجراء أبحاث علمية مستقلة، متناقضة بذلك مع ادعاءات شركات كبرى مثل Anthropic وOpenAI بشأن قرب تحقيق ذلك.

اعتمد الباحثون على منهجية "التقييم الخفي" باستخدام أسئلة بحوث غير منشورة مؤلفو أوراقها الأصلية هم من يقيمون نتائجها، مستخدمين نموذجي Claude Opus 4.8 وGPT-5.6 مع ميزانيات مالية وحوسبية مفتوحة وو بيئة افتراضية متكاملة لضمان عدم تسرب البيانات.

أظهرت النتائج فشل الوكلاء الاصطناعيين في اجتياز تقييمات المؤلفين، حيث رُفضت الأبحاث الناتجة لافتقارها إلى الابتكار وضعف صياغتها، إضافة إلى عجز النماذج عن التفكير الإبداعي، وإبداء ضعف في التراجع عن الفرضيات الفاشلة وإدارة الموارد بفاعلية.

رغم نجاح النماذج في المهام الهندسية ككتابة الشيفرات وتحليل البيانات وتنفيذ مئات التجارب دون تدخل بشري، إلا أن الباحثين خلصوا إلى عجزها عن معالجة تساؤلات بحثية مفتوحة تتطلب مهارات الاستدلال الإبداعي وصياغة فرضيات جديدة.

يأتي هذا الجدل وسط انتقادات متزايدة حول قدرة النماذج اللغوية على الابتكار، حيث يرى خبراء أن قدراتها الحالية تقتصر على الاستنتاج الرياضي والبحث الموجه، بينما تبقى الأبحاث الأصيلة رهينة القدرة البشرية على تفسير الظواهر واستنباط أسبابها.