اختبر باحثون من كلية وارتون بجامعة بنسلفانيا ستة نماذج ذكاء اصطناعي حالية لقياس مدى اتساق توصياتها عند شراء ساعة ذكية. استخدموا محاكي تجارة إلكترونية متخصص يعرض الوكيل صور صفحات المنتجات، فيحللها ثم يختار منتجاً. النتائج كانت مثيرة للقلق.

عندما تعرض الوكلاء على مصدر خارجي واحد قبل اختيار المنتج، تغيرت التوصيات بشكل جذري. عندما رأت نماذج المراجعات من موقع Wirecutter التي تفضل Fitbit Inspire 3، ارتفعت احتمالية اختيار هذا المنتج بـ 90 نقطة مئوية لدى Claude Opus 4.8 و99 نقطة لدى Gemini 3.5 Flash مقارنة بالحالة الأساسية. وأسفرت الاختبارات اللاحقة عن أن ترتيب المصادر وطريقة تقديمها تؤثر بشكل مباشر على القرار.

في تجربة أخرى، طبّق الباحثون نصوص ذاكرة مختصرة على الوكلاء مثل "أحب المشي لمسافات طويلة"، فوجدوا أن بعض النماذج اختارت منتجات أغلى ثماناً وثلاثين مرة أكثر من خيار متفوق موضوعياً كان بسعر 29.99 دولار. Gemini 3.5 Flash أبدى مقاومة أكبر، واختار المنتج الأفضل بنسبة 86 إلى 92 بالمئة بغض النظر عن الذاكرة المدرجة.

تشير النتائج إلى أن إسناد قرارات التسوق إلى وكيل ذكاء اصطناعي لا يضمن توصيات متسقة أو مثلى. المستخدم ذاته قد يتلقى توصيات مختلفة في أيام مختلفة بلا سبب واضح. بالنسبة للبائعين، تحسين استراتيجياتهم لتتناسب مع وكلاء الذكاء الاصطناعي سيكون أصعب من تحسين محركات البحث التقليدية، إذ لا يمكنهم معرفة أي نموذج ينفذ الشراء أو ما قرأه من قبل.