أعلنت شركة بايت دانس وفريق الذكاء الاصطناعي بجامعة تسينغهوا عن "CUDA Agent"، وهو نظام تعلم معزز يهدف لتدريب نماذج لغوية كبيرة على توليد نوى معالجات رسوميات أكثر كفاءة من المجمّعات البرمجية الموجودة. المشكلة التي يعالجها النظام دقيقة لكنها مزمنة: النماذج المتقدمة تنتج بالفعل أكواد CUDA صحيحة، لكنها غالبًا تكون بطيئة.
وضع النظام النموذج داخل بيئة تطوير CUDA حقيقية مزودة بأدوات تحليل الأداء والتحقق من الصحة وصندوق رمل آمن، ثم دربه باستخدام تقنية PPO على مدار 150 خطوة بسياق يبلغ 131072 رمزًا. حقق النموذج المدرب معدل نجاح بلغ 98.8% وتجاوز أداء torch.compile في 96.8% من المهام عبر معيار يضم 250 مهمة، بمتوسط هندسي يصل إلى 2.11 مرة أسرع من المجمّع. تفوق هذه النتائج على نموذجي Claude Opus 4.5 وGemini 3 Pro بنحو 40 نقطة على المهام الأصعب.
اعتمد النظام على نموذج Seed1.6، وهو نموذج خليط متخصص يضم 23 مليار معاملة نشطة و230 مليار معاملة إجمالية. لم تُفرج الفريق عن أوزان النموذج المدرب، لكنه نشر مجموعة بيانات CUDA-Agent-Ops-6K التي تحتوي على 6 آلاف عينة، إضافة إلى مواصفات المهارات والصيغ المستخدمة في التدريب.
طبّق النظام عملية تعلم تتبع نمط ReAct باستخدام أدوات مثل Bash والتحرير والبحث عن الملفات. تضمنت آليات الحماية من الاستغلال نصًا خمسة تدابير أمنية منها تقييد الوصول لأدوات التحقق والتنفيذ اختبارات على مدخلات عشوائية متعددة. استخدم النظام نظام مكافآت منفصل بدلًا من نسب التسارع الخام، حيث يعطي درجات تتراوح بين سالب واحد وثلاثة حسب نجاح وكفاءة النواة المولدة.
أظهرت الدراسة تطبيقات عملية متعددة تشمل عمليات الضرب المصفوفي المحسنة وسلاسل العمليات المركبة. النظام قابل للاستخدام في مجالات متنوعة مثل البنية الأساسية للذكاء الاصطناعي والسيارات ذاتية القيادة والتطبيقات الطبية والعمليات المالية الكمية، خاصة حيث تكون زمن التأخير عاملًا حاسمًا.
Comments (0)
No comments yet. Be the first.