شرحت منصة Hugging Face المكونات الأساسية لضبط نماذج التضمين متعددة الأشعة، وهي: النموذج نفسه، ومجموعات البيانات، ودوال الخسارة، وحجج التدريب، والمقيّمون. أوضحت الشركة أن نموذج mLateOn-medical المدرب على بيانات طبية متخصصة في 14.5 ساعة على معالج RTX 3090 الواحد يتفوق على كل نماذج البحث العامة المتاحة، سواء الكثيفة أو الضرورية أو متعددة الأشعة.
الفرق بين نماذج التضمين الكثيفة والنماذج متعددة الأشعة يكمن في الطريقة: النماذج الكثيفة تضغط النص بأكمله في شعاع واحد، بينما النماذج متعددة الأشعة تحتفظ بشعاع صغير لكل رمز لغوي وتطابق الاستعلام مع الوثيقة على مستوى الرموز. هذا التطابق على مستوى الرموز يحافظ على الإشارات الدقيقة التي تفقدها النماذج الموحدة، مما يؤدي عادة إلى بحث أقوى بتكلفة فهرس أكبر.
ضبط هذه النماذج في المجالات المتخصصة يحسن أداء البحث بشكل كبير لأن المفردات وأسلوب الاستعلامات والمعنى المقصود بالملاءمة تختلف بين البحث العام والاكتشاف القانوني والبحث عن الأكواد ومراجعة الأدبيات العلمية. لأن النماذج متعددة الأشعة تعمل على مستوى الرموز، فإنها تلتقط الإشارات الدقيقة للمجال التي تميل النماذج ذات الشعاع الواحد إلى حذفها، وتستجيب بقوة حتى لكميات متواضعة من بيانات الضبط المتخصصة.
أكدت Hugging Face أن اختيار نقطة الانطلاق للتدريب مهم أكثر مما يتوقعه المطورون. النماذج غير المشرفة التي أكملت التدريب الاستكشافي واسع النطاق لكن لم تخضع بعد للضبط العام تتكيف مع المجالات الجديدة بشكل أفضل من نماذجها المكتملة، متفوقة عليها رغم بدء أداء أقل. النماذج المكتملة والمشرفة بالكامل تتحرك قليلا فقط أو حتى تتراجع عند محاولة إعادة ضبطها.
عملياً، يمكن للمطورين تحميل بيانات التدريب من مستودع Hugging Face للمجموعات البيانية أو استخدام بيانات محلية بصيغ متعددة. البيانات البسيطة من نوع (استعلام، وثيقة ذات صلة) هي الأسهل في الجمع للمجالات المتخصصة وكافية تماما للتدريب الفعال. اختيار دالة الخسارة المناسبة يتوقف على البيانات المتاحة والهدف المطلوب، وللحالات الشائعة من أسئلة الإجابات يعتمد المطورون على دوال خسارة متخصصة موثقة في دليل المنصة الشامل.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.