يعتمد صناع السياسات والباحثون على تقارير شركات مثل Anthropic و OpenAI حول استخدام منتجاتهم، لكن هذه التقارير انتقائية ولا توفر صورة شاملة عن السلوكيات الفعلية للمستخدمين. يقول الباحثون إن «لا توجد مصادر مستقلة لتحقق من هذه البيانات».

أطلقت فريق بحثي من جامعات عدة منها ستانفورد وMIT مشروعًا يسمى AI Observatory بهدف سد هذه الفجوة. يجمع المشروع ويحلل محادثات حقيقية مع نماذج ذكاء اصطناعي شهيرة مثل Claude و Gemini من سبع مجموعات بيانات موجودة تم جمعها بموافقة المستخدمين. وتشير النتائج إلى أن الاستخدامات الفعلية تختلف بشكل كبير عما تنشره الشركات.

عندما طبقت فريق البحث معايير Anthropic على بياناتها، وجدت أن ما يقرب من نصف المحادثات لم تندرج ضمن التقارير المنشورة. تضمنت المحادثات المستبعدة محتوى متعلقًا بالصحة والعلاقات الشخصية بنسبة أعلى، بالإضافة إلى محتوى حساس يتناول المضايقات والكراهية والمحتوى الجنسي بنسب تفوق ما أبلغت عنه الشركات.

كشفت الدراسة فروقات جوهرية في كيفية استخدام الناس لنماذج مختلفة. على سبيل المثال، يفضل المستخدمون Anthropic للبرمجة، و Gemini للاستخدامات الاجتماعية، و ChatGPT لمساعدة الطلاب. كما أظهرت البيانات أن محادثات Grok شهدت تركيزًا أعلى للمعلومات المضللة، خاصة حول الأخبار والسياسة.

أجرى الباحثون تحليلهم على أكثر من 24 ألف محادثة شملت 85 ألف تبادل بين المستخدمين والنماذج بين عامي 2023 و 2025، لكن هذا العدد ضئيل مقارنة بملايين المحادثات التي تملكها الشركات. يؤكد الباحثون أن البيانات المتاحة للعامة ضرورية لتمكين الباحثين من الإجابة على أسئلة حاسمة حول فوائد ومخاطر الذكاء الاصطناعي بعيدًا عن السرديات التسويقية للشركات.