طرحت مختبر BAIR في جامعة بيركلي نهجًا جديدًا لمعالجة تحديات التخطيط باستخدام نماذج العالم المتعلمة، وهي أنظمة ذكاء اصطناعي قادرة على التنبؤ بتسلسلات مستقبلية طويلة في فضاءات عالية الأبعاد. تسمى الطريقة الجديدة GRASP، وتعتمد على ثلاث آليات رئيسية: رفع المسارات إلى حالات افتراضية لتحقيق التوازي الزمني، إضافة العشوائية مباشرة للحالات لتحسين الاستكشاف، وتعديل التدرجات لتجنب مشاكل الإشارات الضعيفة عند التعامل مع نماذج الرؤية عالية الأبعاد.

المشكلة الأساسية التي تواجه التخطيط التقليدي هي انفجار أو اختفاء التدرجات عند محاولة التنبؤ عبر آفاق زمنية طويلة. كلما زاد عدد الخطوات المستقبلية، زادت صعوبة حساب التأثير الفعلي للإجراءات الأولية على النتائج النهائية. بالإضافة إلى ذلك، المهام طويلة الأجل غالبًا تتطلب سلوكًا غير جشع، مثل الالتفاف حول العوائق أو إعادة التموضع قبل دفع شيء ما، وهي تصرفات يصعب على خوارزميات التحسين البسيطة اكتشافها.

المشكلة الثالثة تتعلق بطبيعة النماذج العميقة نفسها. هذه النماذج، رغم أنها تتمتع بأداء عالية على البيانات التي رأتها أثناء التدريب، تصبح حساسة جدًا للغاية عندما تواجه حالات غير مرئية أو توجهات متعامدة مع توزيع البيانات. هذه الظاهرة مشابهة لمشكلة الأمثلة المعاكسة في تصنيف الصور، حيث يمكن تضليل النموذج بتغييرات صغيرة جدًا في المدخلات.

يعالج GRASP هذه المشاكل بتحويل مسألة التحسين من خلال تحديث الإجراءات وحدها إلى تحديث الحالات والإجراءات معًا، مع احترام قيود الديناميكيات. هذا يسمح للخوارزمية بالتنقل عبر مناطق غير فيزيائية مؤقتًا للعثور على خطط أفضل، كما يخفف من حدة مشاكل التدرجات غير المستقرة. وقد طُورت هذه الطريقة بتعاون من باحثين في بيركلي ومختبرات فيسبوك للذكاء الاصطناعي.