طرحت مختبرات الذكاء الاصطناعي بجامعة بيركلي BAIR خوارزمية جديدة تحقق نقلة نوعية في مجال التعلم التعزيزي. تعتمد الخوارزمية على نموذج مختلف جذريًا عن الأساليب السائدة، وتتفادى مشاكل قابلية التوسع التي تواجه طرق الفروقات الزمنية التقليدية.

المشكلة الأساسية في التعلم التعزيزي غير الموجه بالسياسة تكمن في تراكم الأخطاء. عند استخدام طريقة الفروقات الزمنية، ينتشر الخطأ من القيمة المستقبلية إلى القيمة الحالية عبر آليات التنبؤ الذاتي، مما يسبب مشاكل في المهام ذات الآفاق الطويلة. محاولات التخفيف من هذا الأثر باستخدام تعلم n-خطوة لا تحل المشكلة بشكل جذري، بل تقلل عدد التكرارات بعامل ثابت فقط، وتتطلب ضبط معامل إضافي لكل مهمة.

تقترح الخوارزمية الجديدة، المسماة Transitive RL، نموذجًا قائمًا على فكرة قسمة المسار إلى قطاعات متساوية وتجميع قيمهما. هذا يقلل عدد التكرارات بشكل لوغاريتمي بدلًا من الخطي، مما يحسّن التعامل مع المهام الطويلة جدًا. الابتكار العملي الأساسي يكمن في تقييد البحث عن النقاط الوسيطة على الحالات الموجودة فعلًا في بيانات التدريب، واستخدام انحدار التوقعات بدلًا من العمليات الحتمية القاسية.

اختبرت الفريق الخوارزمية على مهام معقدة جدًا من بنك OGBench للتعلم القائم على الأهداف بلا اتصال. شملت الاختبارات مهام تحريك كائنات في متاهات والألغاز بمجموعات بيانات تبلغ مليار عنصر، وتتطلب ما يصل إلى 3000 خطوة بيئية. أظهرت النتائج أن الخوارزمية الجديدة تحقق أفضل أداء مقارنة بعدد من الخوارزميات الأساسية القوية من فئات مختلفة.

الميزة الأبرز للطريقة الجديدة تكمن في أنها تحقق أداءً يعادل أفضل نتائج تعلم n-خطوة، دون الحاجة لاختيار قيمة n يدويًا. بتقسيم المسار بشكل متكرر إلى أجزاء أصغر، تتعامل الخوارزمية مع الآفاق الطويلة بشكل طبيعي. الفريق يشير إلى أن هناك أسئلة مفتوحة عديدة، منها كيفية توسيع الطريقة لتطبيقاتها على مهام التعلم التعزيزي التقليدي، والتعامل مع البيئات ذات الديناميكيات العشوائية.