كشفت منصة Hugging Face عن NeoMME، عائلة من المحركات المتعددة الأنماط والمتعددة اللغات، بنسختين بحجم 260 مليون و800 مليون معامل. يختلف هذا النموذج عن معظم نماذج اللغة والرؤية الحالية بأنه لا يعتمد على برج رؤية منفصل أو نموذج لغة سببي مستقل، بل يستخدم محول ثنائي الاتجاه واحد يمعالج رموز النصوص ورقع الصور الخام معًا.
تم تدريب النموذج من الصفر باستخدام هدف نشر متقطع مقنع على مدار 524 مليار رمز مدخل مضغوط، بينها 290 مليار رمز من أمثلة نصية فقط. يدمج التدريب نصوصًا متعددة اللغات وأكوادًا ورياضيات وصورًا طبيعية وصور وثائق، مما يعزز قدرات النموذج على فهم السياق البصري واللغوي معًا.
عند ضبطه لمهمة استرجاع الوثائق البصرية باستخدام منهج ColPali، حقق NeoMME-Retriever أداءً متقدمًا على معيار ViDoRe v3. نسخة 260M حققت درجة 0.523 بـ nDCG@10 وهي الأعلى بين النماذج تحت 800 مليون معامل، مع استخدام 14 مرة أقل من المعاملات مقابل ColQwen2.5. أما نسخة 800M فوصلت إلى 0.556 بـ nDCG@10 مع استخدام معاملات أقل بـ 3.6 مرات من ColPali v1.3.
يتفوق النموذج أيضًا من حيث السرعة، إذ تقوم نسخة 260M بترميز حوالي 51 صفحة في الثانية الواحدة على معالج NVIDIA L40S بحجم صورة 2048×2048، وهي ضعف سرعة ColModernVBERT. أسلوب التجميع الهرمي والكمية غير المتماثلة يقللان حجم تخزين مؤشرات التفاعل المتأخر من حوالي 1.5 ميجابايت إلى 6 كيلوبايت لكل صفحة، أي 255 مرة أصغر، مع الحفاظ على أكثر من 95% من جودة الاسترجاع الأصلية.
يتيح NeoMME-Retriever إرجاع تضمينات كثيفة وتفاعل متأخر في تمرير أمامي واحد، مما يوفر مرونة للتطبيقات المختلفة. يمكن استخدام التضمينات الكثيفة لاسترجاع سريع عبر فهرس بحث تقريبي، ثم إعادة ترتيب النتائج باستخدام التفاعل المتأخر. توفر Hugging Face جميع نقاط التفتيش تحت رخصة Apache 2.0 وتدعم النموذج عبر مكتبة Transformers.
Comments (0)
No comments yet. Be the first.