تواجه نماذج التنبؤ بمستقبل الفيديو تحديًا جوهريًا يحد من فعاليتها: عدم القدرة على الاحتفاظ بأحداث وحالات الإطارات البعيدة. المشكلة تكمن في التعقيد الحسابي التربيعي الذي تتطلبه آليات الانتباه التقليدية مع زيادة طول التسلسل، مما يجعل معالجة السياق الطويل غير عملية في التطبيقات الحقيقية.

قدم باحثون من ستانفورد وبرينستون وAdobe Research حلًا مبتكرًا من خلال الاستفادة من نماذج الحالة State-Space Models في معالجة التسلسلات بكفاءة. النموذج الجديد المسمى Long-Context State-Space Video World Model يعتمد على تصاميم معمارية متقدمة واستراتيجيات تدريب خاصة لتحسين الأداء على السياقات الطويلة.

اختبر الفريق نموذجهم على مجموعات بيانات تتطلب ذاكرة طويلة الأمد، مثل بيانات Memory Maze و Minecraft المصممة لاختبار المهام المعقدة والاستدلال المكاني. أظهرت النتائج تفوقًا ملحوظًا عن النماذج الأساسية الأخرى في الحفاظ على الذاكرة عبر فترات زمنية طويلة.

جاءت النتائج مصحوبة بأمثلة بصرية توضح قدرة النموذج على توليد تسلسلات متماسكة وأكثر دقة مقارنة بالنماذج التي تعتمد على آليات الانتباه السببي وحدها. كما أثبت النموذج مهارة محسنة في استدعاء واستخدام المعلومات من الإطارات البعيدة، وكل ذلك دون التضحية بسرعات الاستدلال العملية.

تمثل هذه الدراسة، المنشورة على منصة arXiv، تقدمًا مهمًا في تطوير وكلاء ذكية قادرة على التخطيط والاستدلال في بيئات ديناميكية معقدة تتطلب فهمًا متسلسلًا طويل الأمد.