أطلقت AWS بالتعاون مع NVIDIA وشركة Heidi Health دراسة توضح كيفية خفض تكاليف الاستدلال في خدمات التعرف الآلي على الكلام ASR بنسبة تصل إلى 75%. تنبع المشكلة من أن طلب استدلالي واحد يستخدم عادة 15 إلى 20% فقط من قدرات معالج GPU، بينما تبقى 80% من موارده معطلة بسبب آلية الوصول المتسلسل الافتراضية.
اعتمدت الشركات على تقنية CUDA Multi-Process Service المدمجة مع خادم NVIDIA Triton على منصة Amazon EC2 لحل هذه المشكلة. بموجب النهج الجديد، تنخفض عدد وحدات GPU المطلوبة من 16 إلى 4 فقط، مع الحفاظ على كمون أقل من الثانية الواحدة بمعدل 92.1 طلب في الثانية لكل وحدة معالجة. تشغل خادمة Heidi Health أكثر من 2.4 مليون استشارة سريرية أسبوعياً عبر 190 دولة.
تعتمد الحل على ثلاث طبقات تقنية متكاملة. الأولى هي تقسيم GPU إلى 4 أقسام متزامنة باستخدام MPS، كل منها يستخدم 25% من مصادر المعالجة. الثانية تطبيق محرك ONNX Runtime مع TensorRT لتحسين الأداء على مستوى الأجهزة، حيث يعمل المشفر الثقيل على الحسابات عبر ONNX Runtime بينما يعمل فك التشفير بشكل أصلي في PyTorch. الثالثة استخدام خادم Triton لإدارة جدولة الطلبات والمعالجة المجمعة.
يتألف الحل من ثلاث مكونات موضوعة في حاوية Docker على خوادم Amazon EC2 من نوع g6e.4xlarge و g7e.4xlarge المزودة برقائق NVIDIA L40S. بوابة FastAPI تفك تشفير الملفات الصوتية وتوجه الطلبات عبر gRPC، بينما يدير خادم Triton المعالجة المجمعة والموازنة بين الأقسام المختلفة. تبدأ عملية التشغيل بتفعيل خادم MPS ثم تحميل النموذج وإطلاق خادم الاستدلالي.
يقدم المشروع المرفق كوداً مفتوح المصدر يتضمن ملفات Docker والتكوينات اللازمة للنشر السريع. تتحكم متغيرات البيئة بجميع جوانب التشغيل، ما يسمح باستخدام نفس صورة الحاوية عبر أنواع GPU مختلفة. اختارت الفريق عدة قرارات تصميمية حاسمة مثل استدعاء دالة forward مباشرة بدلاً من الطرق التقليدية لتوفير نحو 50 ميلي ثانية من التأخير، وتسلسل تحميل النموذج لتجنب تجاوز ذاكرة GPU.
Comments (0)
No comments yet. Be the first.