كشفت شركة ديب سيك عن ورقة بحثية تقدم منهجًا مبتكرًا لتحسين قابلية توسّع نماذج المكافآت العامة خلال مرحلة الاستدلال. تأتي هذه الخطوة مصحوبة بإشارات من الشركة حول اقتراب وصول نموذجها الجديل R2، مما أثار توقعات قوية داخل مجتمع الذكاء الاصطناعي.

تقدم الورقة البحثية، الموسومة بـ "Inference-Time Scaling for Generalist Reward Modeling"، طريقة جديدة تمكّن نماذج المكافآت العامة من تحسين توليد المكافآت بشكل ديناميكي من خلال إنتاج مبادئ وملاحظات نقدية. يتحقق هذا عبر تقنيات التحسين الدقيق بالرفض والتعلم المعزز القائم على القواعد. يعكس هذا التطور تحولًا متسارعًا في نموذج توسّع نماذج اللغة الكبيرة من مرحلة التدريب المسبق إلى مراحل ما بعد التدريب، خاصة أثناء الاستدلال، وهو الاتجاه الذي أرسته نماذج مثل o1 من OpenAI.

يرتكز هذا المنهج على زيادة الجهد الحسابي المخصص للتعلم المعزز أثناء التدريب، وتوسيع وقت "التفكير" أثناء الاستخدام. أظهرت سلسلة نماذج R1 من ديب سيك أن التعلم المعزز النقي، دون الاعتماد على التحسين الدقيق الموجه، يمكنه تحقيق قفزات جوهرية في قدرات التفكير المنطقي. يوفر التعلم المعزز للنماذج "نموذجًا عالميًا داخليًا" يمكّنها من محاكاة نتائج مسارات تفكير مختلفة وتقييمها واختيار الأفضل منها.

قدمت ديب سيك وباحثون من جامعة تسينغهوا حلًا يُدعى "Self-Principled Critique Tuning" (SPCT) يستهدف تحسين قابلية توسّع نماذج المكافآت العامة أثناء الاستدلال. يعتمد الحل على أخذ عينات متوازية متعددة من نموذج ديب سيك للمكافآت العامة، تولد كل عينة مبادئ وملاحظات مختلفة، ثم يتم اختيار المكافأة النهائية عبر التصويت. يرشد هذه العملية نموذج معاون يسمى "Meta RM" تم تدريبه لتقييم صحة المبادئ والملاحظات المُنتجة.

أثبتت النتائج التجريبية أن تقنية SPCT تحسّن بشكل ملحوظ جودة وقابلية توسّع نماذج المكافآت العامة، متفوقة على الطرق والنماذج القائمة عبر معايير تقييمية متعددة وشاملة دون انحياز ملحوظ تجاه مجالات محددة. مع التركيز المتزايد على الاستفادة من التعلم المعزز وتحسين الاستدلال، يُتوقع أن يدمج نموذج R2 القادم هذه الاكتشافات في معمارية جديدة متقدمة.