الدروس
نادي Hugging Face العلمي: تحطير السياسات المباشر على السياق الحالي
يناقش فريق أبحاث Hugging Face ورقة علمية تقترح طريقة فعّالة لنقل فوائد التعلم المعزز من نماذج صغيرة إلى نماذج أكبر بكثير. بدلاً من محاكاة النموذج الأصغر مباشرة، تقيس الطريقة كيفية تغيير التعلم المعزز لسياسة النموذج الصغير وتستخدم هذا التغيير كإشارة مكافأة كثيفة لتدريب النموذج الأكبر. ينتج عن ذلك شكل من التعميم من الضعيف إلى القوي يطابق أو يتفوق على التعلم المعزز المباشر بجزء صغير من التكلفة الحسابية.
شاهد الفيديو — Hugging Face