شهدت القدرات البرمجية للنماذج الذكية تطورًا ملحوظًا في حل الألغاز خلال الأشهر الأخيرة. في أواخر عام 2024، أظهرت دراسة من جامعة كولومبيا أن أفضل النماذج المتاحة تمكنت من حل 18% فقط من ألغاز «نيويورك تايمز كونيكشنز»، لكن بحلول أوائل 2025 استطاعت بعض النماذج حل هذه الألغاز بكفاءة عالية جدًا.

غير أن الألغاز تكشف أكثر من مجرد التقدم التقني. مراقبة مواضع النجاح والفشل لدى النماذج مقابل الأداء البشري تفتح نافذة على نقاط القوة والضعف الحقيقية. النماذج الحالية لا تزال تعاني من تحديات عديدة؛ التعديلات الطفيفة على الألغاز الكلاسيكية تربكها، والألغاز البصرية تشكل نقطة ضعف واضحة.

في مجال المنطق المكاني، يحتفظ الإنسان بأفضلية كبيرة. نماذج اللغة الحالية، رغم قدرتها على تحليل المدخلات البصرية، تفشل بشكل ذريع في حل مسائل الدوران العقلي التي تتطلب تخيل الأجسام من زوايا مختلفة. يبدو أن هذه النماذج لم تطور القدرة على تلاعب الأجسام ثلاثية الأبعاد بالطريقة التي يفعلها المعماريون والمهندسون.

كشفت دراسة من جوجل وجامعة إلينوي عن مشكلة أخرى: تعتمد النماذج على ذاكرة ضخمة من الحقائق المحفوظة أثناء التدريب. عندما يشبه اللغز ما واجهته النموذج سابقًا، قد تتجاهل الفوارق الدقيقة وتعتمد على ما تحفظته بدلًا من التفكير المنطقي. هذا ينطبق بشكل خاص على ألغاز «الفرسان والعبيد» والاختبارات المشابهة.

في مسائل ثنائية الأبعاد أيضًا، تواجه النماذج صعوبات واضحة. دراسات حول معيار ARC-AGI أظهرت أن النماذج تحقق نتائج أفضل عندما تتلقى البيانات كسلاسل رقمية بدلًا من الصور. حتى عند إجابتها بشكل صحيح، غالبًا تستخدم النماذج قواعد معقدة وغير قابلة للتعميم، في حين يستند الإنسان إلى مفاهيم بصرية بسيطة.

لا تقتصر مشاكل التفكير على الآلات وحدها. الإنسان أيضًا عرضة لأخطاء معرفية معينة لا تشاركها النماذج الذكية. بعض الألغاز تستغل أخطاء بشرية في الحسابات البديهية أو الصياغة المقصودة للإجابات الواضحة التي تنهار عند القراءة المتأنية. في مسائل مثل برج هانوي، تستطيع النماذج حل الإصدارات البسيطة، لكن عندما تتجاوز المشكلة ستة متغيرات تبدأ في الفشل.