طورت أمازون ويب سرفيسز حلًا جديدًا لخفض نفقات تطبيقات الاسترجاع المعزز على منصة بيدروك من خلال إضافة خطوة معالجة وسيطة. يعتمد النمط على استخدام نموذج أصغر وأقل تكلفة مثل Claude Haiku لتصفية الأجزاء المسترجعة من قواعد البيانات والتركيز على ما يتصل مباشرة بسؤال المستخدم، قبل إرسال النتائج إلى النموذج الأساسي الأكثر تكلفة لتوليد الإجابة النهائية.
تظهر الاختبارات التجريبية أن هذا النهج يحقق انخفاضًا في عدد الرموز المرسلة إلى النموذج الرئيسي بمقدار 8.6 أضعاف عند استخدام الضغط وحده، مما يترجم إلى توفير 33 في المائة من التكاليف. عند دمج هذا الأسلوب مع وظيفة إعادة الترتيب، يرتفع الانخفاض إلى 10.1 أضعاف وتوفير 36 في المائة. كما أظهرت الاختبارات تحسنًا في معدل الهلوسة الذي انخفض من 51 في المائة في النمط الأساسي إلى 44 في المائة مع الضغط و38 في المائة عند دمجه مع إعادة الترتيب.
يتم تنفيذ الحل عبر دالة واحدة في خدمة AWS Lambda تنسق بين استدعاءي النموذج باستخدام واجهة برمجة Converse. يُعتبر النمط الأكثر فائدة عندما يكون السياق المسترجع كبيرًا والسؤال محددًا نسبيًا. تشير الاختبارات إلى أن جودة الإجابات تبقى قريبة من المستوى الأساسي، حيث تنحرف درجات التقييم بنحو 0.07 عن الخط الأساسي.
رغم فعالية هذا الأسلوب من حيث التكلفة، يتطلب التطبيق مراعاة عاملي الكمون والجودة. يضيف استدعاء النموذج الأصغر خطوة إضافية في مسار المعالجة، لكن تحسن سرعة معالجة النموذج الرئيسي للسياق المركز يعوض جزءًا من هذا الوقت. للتطبيقات التي تتطلب أداءً سريعًا للغاية يُنصح باختبار الكمون قبل النشر.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.