تواجه عملية تدريب نماذج الذكاء الاصطناعي الضخمة تحديات شبكية متزايدة، خاصة عند تنسيق العمليات الجماعية بين آلاف المعالجات. أدركت ميتا أن الشبكة أصبحت نقطة الاختناق الحرجة في كل خطوة تدريب، وأن أبطأ عملية نقل بيانات تحدد سرعة العملية برمتها.
عرّفت ميتا هذا الأسبوع بروتوكول MetaRoCE، وهو معيار نقل جديد مبني من الصفر ليناسب أعمال الذكاء الاصطناعي على بنية إيثرنت موحدة. يختلف هذا البروتوكول جذريًا عن معيار RoCE التقليدي، إذ بدلًا من افتراض وصول الحزم بالترتيب الصحيح، يتعامل MetaRoCE مع الشبكة على أنها قد تفقد بيانات، ويحول مسؤوليات الترتيب والمسار والاسترجاع إلى بطاقة الشبكة نفسها.
أظهرت الاختبارات على مجموعة من 64 عقدة معالجات AMD أداء متفوقة مقارنة بـ RoCEv2، حيث حقق MetaRoCE معدل إنتاجية أعلى وأوقات استكمال أقصر للعمليات. الأهم أن البروتوكول الجديد يحافظ على حوالي 86% من الإنتاجية حتى عند فقدان 1% من الحزم، ويستمر في تقديم نطاق ترددي مفيد حتى عند فقدان 10% من البيانات.
ستطلق ميتا المواصفات الكاملة للبروتوكول وحزمة اختبار الامتثال وتطبيق مرجعي محسّن من خلال مشروع Open Compute Project في قمة OCP العالمية المقررة في أكتوبر 2026. تم إثبات البروتوكول على بطاقات AMD Pensando القابلة للبرمجة، مع جهود جارية من بائعين آخرين لتطويره.
يعكس هذا التطور توجه ميتا نحو توحيد معايير الشبكات والنقل في البنية التحتية للذكاء الاصطناعي، بما ينسجم مع مبادرة Ethernet Scalable Unified Network التي أطلقتها OCP. يمثل MetaRoCE خطوة كبيرة نحو حل تحديات توسع الشبكات في مراكز البيانات الضخمة.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.