أعلنت شركة Artificial Analysis عن معيار تقييمي جديد لقياس كفاءة خدمات البحث المختلفة عند استخدامها من قبل وكلاء الذكاء الاصطناعي. يشمل المعيار المسمى "Search Index" سبع خدمات بحث هي Parallel و Exa و Firecrawl و You.com و Tavily و Keenable و Brave، وتُختبر جميعها بنموذج موحد هو GPT-5.6 Luna في بيئة تجريبية معيارية.
يعتمد المعيار على ثلاثة اختبارات متساوية الأوزان. الأول يُسمى DeepSearchQA ويتضمن 900 سؤال بحثي يتطلب كل منها استعلامات بحث متعددة. والثاني BrowseComp يختبر 200 حقيقة صعبة التوصل إليها وتحتاج خطوات تصفح متتالية. أما الثالث AA-Omniscience فيغطي 600 سؤال موزعة على ستة مجالات معرفية مختلفة.
أظهرت النتائج أن جودة البحث الأفضل تنخفض معها التكاليف الإجمالية. فعندما يحصل النموذج على نتائج دقيقة من البداية، يستهلك عددًا أقل من الرموز البرمجية. خدمة Parallel Search بنسختها المتقدمة خفضت استهلاك الرموز بأكثر من 40 بالمئة مقابل النسخة الأساسية، مما أسفر عن تكلفة إجمالية أقل رغم ارتفاع تكلفة البحث لكل مهمة.
تشير البيانات إلى أن السرعة الخام لكل استعلام لا تترجم حتمًا إلى نتائج أسرع بشكل عام. فخدمة Parallel Search بصيغة turbo حققت أقصر وقت استجابة، لكن جودتها الأقل أجبرت الوكيل على تكرار عمليات البحث، مما أدى إلى وقت إجمالي متقارب مع النسخ الأخرى.
أشارت Artificial Analysis إلى أن Parallel و Firecrawl و Parallel بصيغة turbo حققت أفضل توازن بين التكلفة والأداء. أوضحت الشركة أن الخدمات الأخرى يمكنها التقدم بطلب للانضمام للمعيار، كما أن المنهجية الكاملة متاحة للعامة.
Comments (0)
No comments yet. Be the first.