شكّلت الألغاز والألعاب دورًا محوريًا في تطور الذكاء الاصطناعي عبر العقود، بدءًا من خوارزميات لعبة الداما في الخمسينيات وصولًا إلى التطبيقات المعاصرة. لكن الأهمية لا تقتصر على قياس التقدم فحسب، بل تمتد إلى استكشاف مواطن القوة والضعف في هذه الأنظمة.

شهدت السنة الماضية طفرة ملحوظة في أداء النماذج الحديثة. في أواخر عام 2024، كانت أفضل النماذج قادرة على حل 18% فقط من ألغاز "كونكشنز" الشهيرة بجريدة نيويورك تايمز. غير أنه بحلول أوائل 2025، نجحت بعض النماذج في حلها بكفاءة شبه مثالية وبشكل متكرر.

تُظهر هذه الحالات دراسية أين تتفوق هذه الأنظمة وأين تعجز، وتوفر نافذة نادرة على طبيعة القدرات الحقيقية للذكاء الاصطناعي مقابل الإمكانيات البشرية. جمعت الصحيفة سبعة ألغاز أربكت النماذج في مراحل مختلفة، لتدعو القراء لاختبار مهاراتهم ومقارنة أدائهم بالآلات.