Lessons
Hugging Face Journal Club: Direct On-Policy Distillation
يناقش فريق أبحاث Hugging Face ورقة علمية تقترح طريقة فعّالة لنقل فوائد التعلم المعزز من نماذج صغيرة إلى نماذج أكبر بكثير. بدلاً من محاكاة النموذج الأصغر مباشرة، تقيس الطريقة كيفية تغيير التعلم المعزز لسياسة النموذج الصغير وتستخدم هذا التغيير كإشارة مكافأة كثيفة لتدريب النموذج الأكبر. ينتج عن ذلك شكل من التعميم من الضعيف إلى القوي يطابق أو يتفوق على التعلم المعزز المباشر بجزء صغير من التكلفة الحسابية.
Watch video — Hugging Face