أصدرت فريق ديب سيك ورقة بحثية بطول ١٤ صفحة حول "تحديات التوسع والتأملات حول أجهزة معمارات الذكاء الاصطناعي"، بمشاركة الرئيس التنفيذي وينفنج ليانج. تستكشف الورقة العلاقة المعقدة بين تطوير النماذج اللغوية الضخمة وتدريبها والبنية الأساسية للأجهزة، مع التركيز على كيفية أن التصميم المشترك بين النموذج والأجهزة يمكنه التغلب على قيود العتاد الحالي وتحقيق تدريب واستدلال اقتصادي على نطاق واسع.
طورت ديب سيك عدة ابتكارات معمارية أساسية لمعالجة التحديات الأساسية للتوسع. يشمل ذلك معمارية ديب سيك موي وآلية الانتباه المختزلة متعددة الرؤوس، التي تقلل استهلاك الذاكرة بشكل جذري. على سبيل المثال، تتطلب ديب سيك فقط ٧٠ كيلوبايت من ذاكرة التخزين المؤقت لكل رمز، مقابل ٥١٦ كيلوبايت لـ LLaMA-3.1 و ٣٢٧ كيلوبايت لـ Qwen-2.5. بالإضافة إلى ذلك، استخدمت الشركة تدريبًا بدقة FP8 المختلطة لأول مرة في نموذج موي ضخم، مما يقلل التكاليف الحسابية بشكل كبير مع الحفاظ على جودة النموذج.
ركزت ديب سيك أيضًا على تحسين سرعة الاستدلال من خلال معمارية متقدمة للمعالجة المتوازية. استخدمت معمارية تراكب الدفعات الصغيرة المزدوجة لزيادة الإنتاجية، وفككت حسابات آلية الانتباه والخبراء إلى مراحل منفصلة لتحقيق تداخل سلس بين الاتصالات والحسابات. كما طبقت استراتيجية "توجيه مدرك للعقدة" لتقليل الضغط على نطاق الاتصالات بين الأجهزة.
عالجت ديب سيك قيود معمارية NVIDIA H800 من خلال اختيارات تصميم ذكية. بسبب تقليل نطاق الاتصال داخل العقدة مقارنة بـ H100، اعتمدت على توازن متقدم بين توازي الأنابيب وتوازي الخبراء. اقترحت الورقة أيضًا حلولًا مستقبلية مثل دمج معالجات مكرسة لإدارة حركة المرور الشبكية وتوحيد الاتصالات ضمن إطار عمل موحد.
تبرز الورقة أهمية التعاون الوثيق بين فريقي البنية التحتية والخوارزميات في تحقيق كفاءة تدريب واستدلال اقتصاديين. يشير البحث إلى أن تقليل حجم الاتصالات الشبكية عبر ضغط FP8 يقلل من حجم البيانات بنسبة ٥٠ بالمئة مقابل BF16، مما يختصر وقت الاتصال بشكل ملحوظ ويعزز الكفاءة العامة.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.