أظهرت دراسة نشرت مؤخرًا على خادم arXiv أن أنظمة الذكاء الاصطناعي المتخصصة بإجراء البحث العلمي لم تصل بعد إلى مستوى يسمح بها باستبدال الباحثين البشريين. قال سايش كابور من جامعة برينستون، أحد المشاركين في الدراسة، إن "الأتمتة الكاملة للبحث ذي الطابع المفتوح لا تبدو قريبة الحدوث الآن".

تطرقت الدراسة إلى جهود فريق من شركة Sakana AI في طوكيو، الذي طوّر نظامًا يُدعى "The AI Scientist" عام 2024 لأتمتة عملية البحث من الفكرة الأولية حتى نشر الدراسة. قدّم هذا النظام ثلاث أوراق بحثية حول عيوب التعلم الآلي للمراجعة العلمية، ونجحت إحداها في الحصول على درجة قبول. غير أن الباحثين اعتبروا أن المراجعة العلمية التقليدية لا توفر معيارًا موثوقًا لتقييم جودة الأبحاث المولدة آليًا.

لاختبار القدرات الفعلية لهذه الأنظمة، ابتكر كابور وفريقه تحديًا جديدًا أسموه "shadow evaluation"، حيث طلبوا من نظام ذكاء اصطناعي، مدعوم بنموذج Claude Opus 4.8 المحسّن، إجراء دراسات بناءً على أسئلة بحثية من ورقتي مؤتمر، ثم عرضوا النتائج على المؤلفين الأصليين للتقييم المتعمق.

أنجز النظام العديد من المهام الهندسية بنجاح، مثل إجراء مئات التجارب على مدى أيام دون الوقوع في حلقات خطأ متكررة، وأداء مراجعات أدبية سليمة، والتقاط بعض مطالباته الخاطئة. إلا أنه فشل في المجمل في تحقيق الأهداف المطلوبة، محققًا درجات بين 1/6 و 2/6 من المقيّمين.

تمثلت المشكلة الأساسية في أن النظام كان يختار عددًا قليلًا من الفرضيات للاستكشاف، ثم يثبت بسرعة على واحدة منها دون محاولة حقيقية للعودة والبحث في مسارات بديلة. عجز تقييمه الذاتي عن كون سلبيًا بما يكفي، مما أدى إلى استمراره في الاتجاه الأول حتى تقليص نتائجه إلى حد يفقدها الفائدة العلمية.