تقدّم نماذج التضمين التقليدية نصاً كاملاً وتحوّله إلى متجه واحد ثابت الحجم، لكن هذا الضغط يفقد معلومات دقيقة قد تكون حاسمة. النموذج الجديد متعدد المتجهات يحافظ على متجه منفصل لكل رمز نصي، مما يسمح بمطابقة على مستوى الرمز لا يستطيعها البحث الكثيف التقليدي.
تُستخدم في هذه النماذج عملية تفاعل متأخرة، حيث يتم ترميز المستندات مسبقاً بشكل مستقل ثم تُقيّم الاستعلامات ضدها عند البحث باستخدام معامل MaxSim. يقارن هذا المعامل كل رمز في الاستعلام بكل رمز في المستند ويختار أفضل مطابقة، مما يحقق توازناً بين سرعة البحث والدقة الدلالية.
تتفوق هذه النماذج في حالات البحث المعقدة، مثل البحث عن أريكة خضراء بأرجل خشبية وكراسي مستديرة، حيث يمكن لكل متطلب أن يجد دليله المستقل بدلاً من دمج كل المتطلبات في متجه واحد. كما تعالج مشكلة المرادفات والصياغ المختلفة للمعنى الواحد بكفاءة أفضل من الطرق القديمة.
التكلفة الرئيسية لهذا التحسن تكمن في حجم الفهرس، حيث ينتج متجهات أكثر بكثير من النموذج الكثيف التقليدي. لكن مع الضغط المتقدم مثل PLAID، يصبح حجم الفهرس مشابهاً لفهارس الأنماط الكثيفة الحالية.
أطلقت Hugging Face في الإصدار ٦.٠ من Sentence Transformers دعماً مدمجاً لهذه النماذج، مما يسهل على المطورين استخدامها بدون مكتبات خارجية إضافية. يمكن تحميل هذه النماذج بسطر واحد من الكود، سواء كانت من PyLate أو Stanford-NLP أو عائلة ColPali للبحث في صور المستندات.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.