قدمت دراسة فنية حديثة منهجية شاملة لضبط نماذج اللغة الآلية على أساس تعلم التفضيلات البشرية. يركز المشروع على استخدام تقنية تحسين التفضيلات المباشرة بالتزامن مع مجموعة بيانات Anthropic HH-RLHF، حيث يتم تحليل الاستجابات المفضلة والمرفوضة لتطوير نماذج أكثر توافقًا مع احتياجات المستخدم.

تبدأ العملية بفحص دقيق لمجموعة البيانات بهدف كشف التحيزات المحتملة المرتبطة بطول الاستجابات والفروقات الهيكلية. يتضمن ذلك تطبيق اختبارات تشخيصية لتحديد ما إذا كانت الأنماط اللغوية السطحية وحدها كافية للتمييز بين الاستجابات المقبولة والمرفوضة، مما يساعد في منع النموذج من الاعتماد على اختصارات غير مقصودة.

تتناول الدراسة إعداد بيئة برمجية موثوقة باستخدام مكتبات TRL وLoRA، مع توفير مرونة لتكييف العملية مع إصدارات مختلفة من المكتبات الأساسية. يتم تحضير البيانات من خلال تطبيق قوالب حوار موحدة وتصفية الأمثلة التي تتجاوز حدود الرموز المحددة مسبقًا.

عملت الدراسة على تدريب نموذج Qwen2.5-0.5B-Instruct وتقييم أدائه من خلال مقاييس متعددة تشمل دقة المكافآت والفقدان التدريبي. يتم فحص الأداء عبر مجموعات بيانات فرعية مختلفة والتحقق من وجود أي انحياز نحو الاستجابات الأطول.

تؤكد الدراسة على أهمية الجمع بين تدقيق مجموعة البيانات والتحليل التشخيصي والتدريب الفعال بتقنية DPO، مما يوفر إطار عمل قوي لفهم وتحسين محاذاة التفضيلات في نماذج اللغة. كما يتم حفظ النموذج المدرب والمحلل للاستفادة منه في تجارب لاحقة.