كشفت Cohere تفاصيل محرك Megakernel لتشغيل نموذج North Mini Code بكفاءة أعلى على معالجات Nvidia H100.

ويهدف التصميم إلى دمج عدد كبير من عمليات GPU داخل نواة تشغيل واحدة بدل الانتقال المستمر بين عمليات منفصلة.

وتقول الشركة إن ذلك يقلل زمن التنفيذ والهدر الناتج عن عمليات إطلاق النوى المتكررة.

وفي اختبارات التشغيل حقق المحرك تحسنًا ملحوظًا مقارنة ببعض إعدادات vLLM التقليدية.

وتزداد أهمية هذه التحسينات مع ارتفاع تكلفة تشغيل النماذج على ملايين الطلبات يوميًا.

ويظهر التطوير أن المنافسة في AI لم تعد في النموذج وحده، بل في محركات الاستدلال التي تشغله أيضًا.