كانت بطاقات الرسومات GPU مركز اهتمام ثورة الذكاء الاصطناعي منذ انطلاقتها، لكن ظهور أنظمة ذكاء اصطناعي موكول غير قواعد اللعبة تماماً. أفادت تقارير بأن شركة Amazon Web Services أصدرت توجيهات لمهندسيها بترشيد استهلاك دورات المعالجة بأي ثمن، بعدما شهدت الشركة قفزة حادة في أوقات الانتظار للحصول على سعة خوادم المعالج المركزي.
المشكلة تكمن في طبيعة عمل الأنظمة الموكولة. عندما ينفذ نموذج لغوي كبير مهمة ما، فإنه يستدعي أدوات متعددة مثل كتابة ملفات أو تنزيل حزم برمجية أو استدعاء واجهات برمجية. هذه العمليات تعتمد بشكل أساسي على المعالج المركزي، بينما يقتصر دور بطاقة الرسومات على تنفيذ الحسابات الرياضية للنموذج. الباحثون في جورجيا للتكنولوجيا وجدوا أن سبعة من ثمانية مراحل في خطوط عمل الذكاء الاصطناعي الموكول الواقعية تعمل بالكامل على المعالج المركزي.
تضاعف التحدي مع نمو النماذج. تحويل النصوص إلى رموز رقمية (tokenization) يتطلب معالجة متكررة، خاصة عندما يعود نموذج الذكاء الاصطناعي إلى نتيجة استدعاء أداة ويضيفها إلى السياق الأصلي. في حالات النماذج التي تعالج ملايين الرموز كما هو الحال مع Claude من Anthropic، يمكن أن ترتفع مدة الانتظار للحصول على أول كلمة من الرد بمعدل 1.5 إلى 7 مرات. كما أن الضوابط الأمنية والفحوصات السياسية على إجراءات النموذج تضيف عبئاً إضافياً على المعالج المركزي.
العلامات على هذه الأزمة واضحة في السوق. نفدت شركة Intel من مخزون معالجات الخوادم حتى نهاية السنة، بينما ضاعفت AMD توقعاتها لمبيعات معالجات الخوادم. أطلقت شركات Arm و Qualcomm معالجات جديدة موجهة للذكاء الاصطناعي الموكول، وحتى NVIDIA أعطت أولوية قصوى لمعالج Vera المبني على معمارية Arm. قد تؤدي موجة الطلب هذه إلى نقص عام في المعالجات المركزية وارتفاع أسعارها، تماماً كما حدث مع بطاقات الرسومات والذاكرة.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.