كشفت دراسة حديثة أجراها باحثان مستقلان في مجال الذكاء الاصطناعي أن أدوات المساعدة البرمجية الشهيرة تفتقر إلى القدرة على إدراك مرور الوقت. اختبر الباحثان مساعدي البرمجة Claude Code من Anthropic و Codex من OpenAI، من خلال تكليفهما بتقدير المدة المطلوبة لإنجاز مهام محددة، ثم قياس الوقت الفعلي المستغرق.
أظهرت نتائج الاختبار، التي شملت 200 مهمة من مجموعة ProgramBench و18 معيارًا خاصًا بالباحثين، أن الأداتين بالغتا بشكل متسق في تقدير الزمن المطلوب. في ProgramBench، تجاوزت كلا النموذجين التقدير بحوالي 90 دقيقة بغض النظر عن مستوى صعوبة المهمة. في الاختبار الثاني، انحرف Claude عن الحقيقة بثلاثة أضعاف في المتوسط، بينما انحرف Codex بمعدل يتراوح بين ستة وعشرة أضعاف. كانت التنبؤات أسوأ للمهام القصيرة، وقارب التنبؤ الواقع فقط عندما امتدت المهام لساعات عديدة.
كشف البحث أن الأداء يختلف بناءً على بيئة البرنامج المستخدمة. يستمر Claude Code في العمل حتى ينتهي، بمتوسط حوالي 90 دقيقة، بينما يتوقف Codex بعد نحو 30 دقيقة بغض النظر عن المهمة. يتخذ نموذج Claude Code خطوات أكثر بمعدل 2.5 ضعفًا مقارنة بـ Codex.
إضافة إلى عجزها عن إدراك الوقت، أظهرت الأدوات عدم موثوقية في تقييم جودة عملها. الإصدارات الأقدم Opus 4.8 و GPT-5.5 بالغت في تقييم نتائجها بفارق 20 نقطة في المتوسط، حتى عندما فشلت تمامًا. في حالة واحدة، اعتبرت كلا النموذجين عملها ناجحة بنسبة 70 في المئة، بينما كانت النسبة الحقيقية 7 و 14.5 في المئة فقط.
يرى الباحثون أن القدرة على التقييم الذاتي ضرورية لتنفيذ المهام الطويلة التي تستغرق ساعات. عندما حصل الوكيل على أداة تظهر الوقت المنقضي، تحسّن أداؤه بشكل ملحوظ وأصبح دقيقًا تقريبًا في كل مرة. يعتزم الباحثون اختبار ما إذا كانت الوكلاء قادرة على الالتزام بمدة زمنية محددة للعمل.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.