أطلقت فرق بحثية من Google Cloud AI Research وجامعتي واشنطن وتشابل هيل منصة EnvHarness، وهي طبقة برمجية تحول معايير تدريب الوكلاء الثابتة إلى بيئات متكيفة تتغير مع تطور السياسات المدربة عليها. تعالج هذه المنصة مشكلة أساسية في تدريب وكلاء اللغة الكبرى، إذ أن البيئات الحالية مبنية يدويًا وغير قابلة للتعديل، مما يحد من قدرتها على استهداف نقاط الضعف في أداء الوكيل.
تعمل EnvHarness بفلسفة معاكسة للحل التقليدي الذي يعتمد على توليد بيئات جديدة باستمرار. بدلًا من ذلك، تلتف حول البيئة الموجودة عبر مكونات إضافية تعمل حصريًا من خلال واجهة معيارية، مما يسمح بتغيير نقاط بداية الحلقات والإجراءات المتاحة والمدخلات المرئية، بينما يبقى المحاكي والمهام والتحقق البشري دون تعديل.
يقوم نموذج لغوي يسمى EnvRigger بكتابة هذه المكونات تلقائيًا بناءً على الأخطاء المنهجية التي يشخصها في عمليات الوكيل التجريبية. يتضمن النظام ثلاثة مكونات أساسية يمكنها العمل معًا بحرية، ويجري تصفية المرشحين غير القابلين للحل والسهلة جدًا على حد سواء.
أظهرت الاختبارات عبر خمس معايير في أربع مجالات تحسنًا ملحوظًا. ارتفع متوسط ALFWorld من 62.4 إلى 68.3 نقطة، مع زيادة 9 نقاط في الاختبارات خارج التوزيع المتعارف. في SWE-bench Verified، ارتفعت نسبة الحل من 49.88% إلى 52.58%، مع انخفاض خطوات التنفيذ بنسبة 9.8%. تفوقت EnvHarness على منصات التوليد الخاصة بالمجال بهامش 2.46 نقطة مع تقليل 5.11 خطوات إضافية.
تتوفر المنصة برخصة Apache 2.0 مع محركات عملية لستة بيئات، وتتطلب فقط تطبيق واجهة واحدة لإضافة معيار جديد. المتطلب الأساسي الوحيد هو وجود بيئة قابلة للإعادة، مما يستثني الحسابات الحية والروبوتات الفعلية.
Comments (0)
No comments yet. Be the first.