تسعى نماذج العالم الذكية إلى أن تكون الأساس الناقص لعملاء ذكاء اصطناعي مستقلين، لكن الجيل الحالي منها يتجاهل عنصرًا بالغ الأهمية. دراسة جديدة توضح أن أنظمة مثل Sora و Genie و JEPA و Marble تقتصر على نمذجة الطبقة المادية فحسب: الأجسام والمواضع والحركة والإخفاء. بينما لا تعكس اهتمامها ما يدور داخل أذهان الأشخاص من معتقدات وأهداف وتصورات اجتماعية، وهو ما يحرك السلوك البشري بشكل أساسي، خاصة في تطبيقات الروبوتات الخدمية والمساعدات الطبية.

توضح الدراسة الفجوة بمثال بسيط: إذا نُقلت كوب شخص إلى دولاب حين غيابه، تبدو المشهد صحيحًا للنموذج المادي البحت، لكنه يتنبأ بالإجراء التالي خطأً. فقط نموذج يتتبع معتقد الشخص عن مكان الكوب يستطيع شرح تصرفه الفعلي. الإطار الجديد المسمى Mental World Modeling يوسع النماذج التقليدية بمتغيرات ذهنية تشمل المعتقدات والانتباه والأهداف والنوايا والعواطف والمعايير الاجتماعية والعلاقات. كل إجراء ينقسم إلى حامل مادي كالكلام أو الإشارة والقبض، وحمولة ذهنية كالتعزية أو الخداع أو الرفض.

اختبر الباحثون النظرية ببناء نظام يسمى MENTIS لا يتطلب تدريبًا إضافيًا. وطورّوا قاعدة بيانات تقييم تضم 448 مشهدًا قراريًا شملت اختبار ثماني نماذج لغوية من OpenAI و Anthropic. أظهرت النتائج أن النموذج المباشر حقق دقة 63.3%، وبتطبيق التناسق الذاتي ارتفعت إلى 77.9%، بينما بلغت دقة إطار العمل الكامل 87.9% مقابل 98.5% للبشر.

المكاسب الأكبر ظهرت في المشاهد بين الأشخاص حيث تحسنت الدقة بـ 26.4 نقطة مقارنة بـ 14 نقطة فقط في المشاهد المركزة على الأجسام. عند استبدال مراحل خط الأنابيب بالحلول المرجعية البشرية، وصل الأداء إلى 97 نقطة، ما يشير إلى أن معظم الفجوة المتبقية تكمن في أخطاء محاكاة التحولات.

البحث يأتي في سياق نقاش أوسع حول ماهية نماذج العالم الحقيقية. بينما يعتبرها البعض العرهان الكبير بعد النماذج اللغوية البحتة، يشكك آخرون في قدرة الأساليب التوليدية. الدراسة تضيف أن التطورات المستقبلية يجب أن تركز على محاكاة كيف يتغير العالم المترابط ماديًا وذهنيًا، وليس مجرد وصف الحالة الراهنة.