تمثل المخرجات المنظمة والصحيحة البنية أحد أكثر التحديات عملية التي تواجه نماذج اللغة الكبيرة، إذ يعتمد توصيل النموذج بأنظمة لاحقة على قدرته على الامتثال الدقيق للصيغة المطلوبة وتسلسل البيانات. غير أن معايير التقييم الموجودة تدمج هذا الجانب ضمن مقاييس أوسع للاستدلال والاستخراج بدل قياسه بمعزل.

اختبرت فريق Hugging Face نموذج LFM2.5 بـ 350 مليون معامل على معيار IFStruct، وهو اختبار متخصص لقياس توافق مخرجات النماذج مع المخططات المطلوبة. حقق النموذج الأساسي نسبة 22.6% على المعيار، وعند إضافة طبقة معادلة LoRA وتطبيق تدريب بالمكافآت لـ 100 خطوة فقط على حوالي 500 عينة، ارتفع الأداء إلى 29.7%.

ركز التحسن بدقة على المجال المستهدف: ارتفعت دقة مخرجات JSON من 18% إلى 31.9%، بينما ظل أداء YAML دون تغيير يذكر. استخدم الباحثون ثلاث دوال مكافآت مدرجة على مقياس من صفر إلى واحد لتقييم صحة البيانات المستخرجة وعدد الحقول المطابقة. التدريب استهدف حوالي 1.66% فقط من معاملات النموذج عبر محول LoRA مخصص للبنية الهجينة للنموذج.

على الرغم من أن الأداء النهائي ما يزال أقل من نموذج Qwen3.5 الأكبر بـ 2 مليار معامل الذي حقق 33.15%، فإن النتائج تدل على أن التدريب الموجه بمكافآت بسيطة يمكنه رفع موثوقية النماذج الصغيرة بشكل كبير. هذا النهج يوفر سبيلًا فعالًا اقتصاديًا لتحسين أداء النماذج الخفيفة في مهام متخصصة دون الحاجة إلى موارد حسابية ضخمة.