تختلف نفقات الذكاء الاصطناعي التوليدي جذريًا عن أنواع التكاليف التقليدية. بينما ينمو الحساب العادي مع السعة المخصصة، فإن الإنفاق على الذكاء الاصطناعي ينمو مع السلوك الفعلي للمستخدمين، حيث قد ينفق مهندس واحد في ساعات قليلة ما ينفقه فريق كامل في أسبوع. أدركت شركة Jamf التي تخدم أكثر من 76 ألف منظمة لإدارة أجهزة Apple هذا التحدي عندما وسعت نطاق الوصول إلى Amazon Bedrock بين فريق الهندسة، فارتفعت الإنتاجية لكن معها ارتفعت الحاجة للتحكم المالي الدقيق.
ابتكرت Jamf منظومة إنتاجية تتابع الإنفاق اليومي لكل مهندس وتطبق قيودًا متدرجة على نماذج معينة عند اقتراب الميزانية. فمثلًا تمنع نموذج Claude Opus عند 80% من الميزانية اليومية، و Claude Sonnet عند 100%، لكن تبقي Claude Haiku متاحًا ليستمر المهندسون في العمل بتكلفة أقل. تسري هذه القيود في دقائق قليلة دون الحاجة لإعادة مصادقة، وتُلغى تلقائيًا عند إعادة تعيين الميزانية اليومية.
تعتمد المنظومة على ثلاثة مكونات متخصصة: قياس النفقات عبر جداول Amazon Athena التي تحول عدد الرموز إلى دولارات، ثم تحديد المستخدمين المراد تقييد وصولهم بواسطة Lambda، وأخيرًا فرض القيود عبر سياسات إدارة الهوية والوصول المخصصة. يعمل برنامج Lambda كل 15 دقيقة ليحسب قائمة المستخدمين المقيدين بناءً على الإنفاق التراكمي للعام.
للمهندسين الذين يحتاجون حقًا إلى حدود أعلى بسبب نقل بيانات كبير أو تقييم نماذج، توفر المنظومة أمر Slack خاص يسمح للمسؤولين بمنح حدود مؤقتة مرفوعة مع تسجيل كامل للعملية والمصرح بها. تُحفظ هذه الاستثناءات في جدول DynamoDB مع انتهاء صلاحيتها تلقائيًا.
تؤكد Jamf أن هذا النهج يجيب على ثلاثة أسئلة حاسمة للقيادة: كم ينفق كل فرد، وهل يمكن تحديد النفقات دون إبطاء الإنتاجية، وهل المكاسب الفعلية تبرر التكلفة. وفر الكود الكامل للمنظومة عبر مستودع GitHub الخاص بـ AWS للمؤسسات الراغبة في تطبيق حوكمة مالية مماثلة على نشر الذكاء الاصطناعي لديها.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.