كشف معهد ألن للذكاء الاصطناعي عن إطار عمل شامل يدمج عدة استراتيجيات لتدريب نماذج اللغة الكبيرة بكفاءة أعلى. يتضمن الإطار ثلاث مراحل تدريب رئيسية: الضبط الدقيق الموجه والتحسين المباشر للتفضيلات والتعلم المعزز باستخدام المكافآت القابلة للتحقق، مما يسمح بتحقيق أداء محسّنة على المهام الرياضية المعقدة.
صُمم الإطار ليعمل بكفاءة على أجهزة ذات موارد محدودة، حيث تم تكييف المكونات الموزعة الأصلية مثل vLLM وRay وDeepSpeed مع مكتبات خفيفة الوزن من Hugging Face وPyTorch. يتضمن العملية استخراج دوال الخسارة والأداة المساعدة الأصلية من المستودع دون الحاجة لتحميل مكدس التدريب الموزع بالكامل.
ينطوي التطبيق العملي على معالجة بيانات GSM8K وتحويلها إلى صيغة حوارية متسقة لكل مرحلة تدريب. يتم استخدام وحدات التحقق الحتمية لتقييم الإجابات الرياضية بموثوقية، مما يتيح قياس تحسن الأداء عبر كل مرحلة من مراحل التطوير.
يعتمد الإطار على محولات LoRA المتخصصة التي تقلل من استهلاك الموارد الحسابية، وتطبيق الدقة المختلطة والتدرج الموازن لتحسين الاستقرار. كما يوفر آلية مدمجة لمراقبة دقة التفضيلات وهوامش المكافآت طوال عملية التدريب.
أظهرت النتائج كيف تساهم كل مرحلة تدريب في تحسين قدرات النموذج على معالجة المسائل الرياضية. بدءًا من إنشاء خط أساس، ثم تحسين الاستجابات للتعليمات من خلال الضبط الدقيق، وصولًا إلى تحسين المكافآت المتحققة منها بواسطة المكونات الذكية. يمكن دمج محولات LoRA وحفظ النموذج النهائي للاستخدام اللاحق.
Comments (0)
No comments yet. Be the first.