تواجه فرق الذكاء الاصطناعي التي تطوّر وكلاء في بيئات الإنتاج مشكلة متزايدة: تنوّع أطر العمل لا يتوقف، لكن أدوات التقييم لم تواكبه. معظم أنظمة التقييم الحالية تفترض أن الوكيل بُني بطريقة محدّدة جداً، ما يقيّد التوافقية ويحطّم خط أنابيب التقييم فور الخروج عن تلك الحدود الضيّقة.
يستخدم الفريق LangGraph لتنسيق أسير العمل، و LlamaIndex لتكاملها مع خطوط استرجاع البيانات، و OpenAI Agents SDK عند توحيد المؤسسة على نماذج GPT. يلجأون أيضاً إلى Google ADK للتنسيق بين وكلاء متعددة، و Claude Agent SDK للاستفادة من قدرات Anthropic، و Strands Agents لسرعة نشرها على Amazon Bedrock AgentCore. والآن ينتشر كل هذا على منصة AgentCore runtime، التي توفّر البنية التحتية للاستضافة والتوسّع والذاكرة والمراقبة.
حلّ أمازون يفكّك الالتباس بفصل التقييم عن اختيار الإطار. كل أطر العمل الرئيسية تدعم OpenTelemetry إما بشكل أصلي أو عبر مكتبات تطبيق مجتمعية. مادامت بيانات الوكيل تتدفّق عبر OpenTelemetry، تستطيع خدمة التقييم تقييمها بصرف النظر عن الأداة الأساسية. OpenTelemetry معيار محايد يوحّد كيفية إصدار الأنظمة الموزّعة للتتبعات والمقاييس والسجلات.
تُنتج عملية تنفيذ الوكيل أنواعاً متعددة من البيانات: استدعاءات النماذج، استدعاءات الأدوات، استرجاع المستندات، إعادة ترتيب النتائج، توليد التضمينات، فحوصات الحماية، وخطوات التنسيق. تحتاج خدمة التقييم إلى ثلاث أنماط بيانات فقط: استدعاءات النماذج، وتنفيذ الأدوات، واستدعاءات الوكيل نفسها. البيانات الأخرى توفّر سياقاً إضافياً لا تتطلّبه المقيّمات. هذا يضمن التوافق مع الأطر الجديدة التي تضيف أنواع بيانات مستقبلاً.
تصنّف الخدمة كل بيانات واردة، تستخرج القيم المطلوبة من الأنماط الثلاثة، وتمرّر البقية كسياق إضافي. تختلف الأطر في أسماء الخصائص وهياكل البيانات، لكن خدمة التقييم تجسّر بين معياري OpenTelemetry وOpenInference للوصول إلى النتيجة نفسها. عندما يبدأ التقييم، تجلب الخدمة بيانات الوكيل من CloudWatch، وتعيد بناء الجلسة مجمّعة حسب معرّف الجلسة. كل دورة مستخدم واحدة هي تتبّع واحد، مكوّن من الأنماط الثلاثة. بعد تصنيف البيانات واستخراج القيم، يُسلّم الوكيل إلى المقيّمات، فيصبح التقييم محايداً تماماً تجاه الإطار المستخدم.
لا تحتاج إلى أي تكوين إضافي. كل مكتبة OpenTelemetry تضع علامة على اسم الحزمة على البيانات، والخدمة تستخدمها لتقرير كيفية قراءتها. يتفعّل الإجراء الصحيح تلقائياً من مكتبة التطبيق المثبّتة، بدون تغييرات في كود الوكيل. التغطية تتجاوز الأطر المُسمّاة: أي مكتبة اسم حزمتها يبدأ بـ opentelemetry.instrumentation.* أو openinference.instrumentation.* تُقرأ عبر مسار عام. في الممارسة، دعم إطار جديد يحتاج عادة فقط إلى تثبيت مكتبة تطبيق موافقة.
المتطلبات الأساسية للتقييم الشامل اثنان: أولاً، يجب أن تحمل بيانات الوكيل معرّف جلسة متطابق مع معرّف الجلسة الذي استُدعي الوكيل معه. على منصة AgentCore runtime، يُضاف هذا تلقائياً، فلا حاجة لتعديل كود. ثانياً، يجب أن يتضمّن مصدر البيانات محتوى الرسائل، لا البيانات فقط. للوكلاء بالمراقبة الموحّدة، هذا تلقائي. للوكلاء القديمة، البيانات توجد في مجموعات سجلات منفصلة، فيتطلّب تشكيل مصدر بيانات صحيح.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.