أثبتت نماذج OpenAI وDeepSeek-R1 فعالية استخدام التعلم التعزيزي الضخم في تطوير قدرات الاستدلال لدى نماذج اللغة الكبيرة. لكن الطرق التقليدية لتدريب هذه النماذج تواجه تحديات تتعلق بانخفاض كفاءة استخدام البيانات وضعف الأداء على مجالات متعددة.
قدم فريق Kwaipilot في شركة Kuaishou حلاً جديداً باسم SRPO وهي اختصار لـ Two-Staged history-Resampling Policy Optimization. يعتمد النموذج على مرحلتين من التدريب تعالج تضارب أطوال الإجابات بين المسائل الرياضية والبرمجية، بالإضافة إلى آلية إعادة أخذ العينات من السجل التاريخي لتحسين جودة تحديثات التدرج.
حقق نموذج SRPO-Qwen-32B نتائج ملحوظة في المعايير المعتمدة، حيث وصل إلى 50 نقطة في اختبار AIME24 و41.6 في LiveCodeBench، متفوقاً على نموذج DeepSeek-R1-Zero بنسخته ذات 32 مليار معامل. الأهم أن هذه النتائج تحققت باستخدام عُشر عدد خطوات التدريب المطلوبة للنموذج المقارن.
لاحظ الفريق أن النموذج طور قدرة على التفكير الذاتي والتحقق من الإجابات بشكل تلقائي، حيث أبدى أنماطاً متكررة من الفحص والتردد والاستكشاف. في المراحل المتقدمة من التدريب، تعلم النموذج استخدام أكواد برمجية للتحقق من الحلول الرياضية، مما يدل على قدرته على دمج أساليب تفكير متعددة.
نشر الفريق ورقة بحثية تفصيلية عن الطريقة وأتاح نموذج SRPO-Qwen-32B للاستخدام العام على منصة HuggingFace.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.