توصلت دراسة بحثية من فريق IBM Research إلى نتيجة مثيرة للاهتمام عند اختبار تقنية ALTK-Evolve على ثمانية نماذج ذكاء اصطناعي مختلفة: الذاكرة الخاصة بالوكلاء ليست ميزة موحدة، بل تتطلب معايرة دقيقة تختلف من نموذج إلى آخر. التقنية تستخلص من تجارب الوكيل السابقة إرشادات قابلة للتطبيق وتُعيد حقنها في سياق التشغيل، دون تحديث أوزان النموذج أو تدخل بشري.
قسّمت الدراسة النماذج إلى ثلاث فئات واضحة. النماذج القوية ذات السعة الإضافية، مثل DeepSeek-V3.2 بـ 671 مليار معامل، استفادت من مجموعة الإرشادات الكاملة وحققت تحسّنًا بـ 9.5 نقطة مئوية في إكمال المهام. النماذج الأضعف مثل gpt-oss-120b بـ 117 مليار معامل تفضّل نواة مضغوطة عالية الثقة مع إرشادات محددة لكل مهمة، محققة تحسّنًا بـ 16.1 نقطة مئوية بزيادة رموز تبلغ فقط 5 بالمئة. أما النماذج المشبّعة مثل GLM-5 بـ 745 مليار معامل فلم تظهر أي تحسّن ملموس.
أظهرت التجارب على منصة AppWorld بـ 585 مهمة متعددة المراحل أن الاسترجاع المنتقى يحقق أفضل توازن بين الدقة والتكلفة. النتيجة المهمة أن حجم النموذج وحده لا يحدد الفئة التي ينتمي إليها، بل عوامل متعددة منها حجم نافذة السياق والمعمارية وجودة الإرشادات وتوزيع المهام.
تُظهر الدراسة أن تقنية Prompt Caching تلعب دورًا حاسمًا في الإنتاج، حيث تحفظ الأجزاء الثابتة من مجموعة الإرشادات في الذاكرة المؤقتة، مما يقلل التكلفة الفعلية بشكل كبير. الوكلاء لم تُظهر زيادة في عدد خطوات الاستدلال عند استخدام الذاكرة مقارنة بالخط الأساسي، مما يعني أن التكلفة الإضافية تأتي من توسع الإدخال لا من إطالة المسارات.
الدرس الأساسي، وفقًا للفريق، هو عدم إعطاء الوكيل كل ما تعلّمه، بل الكمية التي يستطيع فعلًا استخدامها. للنماذج الضعيفة هذا يعني نواة مضغوطة مع بعض الدروس الخاصة بالمهام، وللنماذج القوية يعني الحفاظ على مجموعة الإرشادات الكاملة مع الاعتماد على Prompt Caching لجعلها ميسورة الثمن.
Comments (0)
No comments yet. Be the first.