أعلنت ميتا عن إطلاق نموذج Muse Spark 1.3 عبر منصتي Muse Code وMeta Model API. بدأت السلسلة في أبريل بالنسخة الأولى، تبعتها 1.1 في يوليو و1.2 في أغسطس. النسخة xhigh متاحة حاليًا، بينما النسخة max الأكثر استهلاكًا للموارد الحسابية ستطرح لاحقًا بعد اختبارات أمان إضافية وتعمل حاليًا كعرض محدود للشركاء.
الميزة التسويقية الأساسية للنموذج تكمن في التسعير. بسعر ثابت 1.25 و4.25 دولار لكل مليون رمز إدخال وإخراج، تبلغ تكلفة المهمة الواحدة 0.55 دولار. لا يوجد أي نموذج يسجل 59 نقطة أو أعلى برسوم أقل، وتتراوح تكاليف النماذج المنافسة عند نفس مستوى الأداء بين 0.94 و1.23 دولار. لكن النسخة الجديدة أغلى من سابقتها 1.2 التي كانت بـ 0.40 دولار.
على مؤشر الذكاء، حققت النسخة max 62 نقطة و xhigh 61، بارتفاع من 57 في أغسطس و53 في يوليو. يعود الارتفاع إلى تغيير طريقة الترجيح في الاختبارات. يشكل GDPval-AA v2 نسبة 20 بالمئة، Terminal-Bench 2.1 نسبة 16 بالمئة، و τ³-Bench Banking 14 بالمئة، وتركزت أكبر مكاسب ميتا في هذه الاختبارات الثلاثة تحديدًا.
في اختبار τ³-Banking الذي يحاكي عمليات بنكية، حققت النسخة max 52 بالمئة في المرتبة الأولى حاليًا وفق Artificial Analysis، وهي الصدارة الوحيدة التي يحققها النموذج. أما النسخة xhigh المتاحة فتصل إلى 47 بالمئة متساوية مع Claude Fable 5.1 و GLM-5.3-Flash. في اختبار Terminal-Bench 2.1 لقدرات البرمجة، ارتفعت النتيجة من 80 إلى 85 بالمئة على xhigh و86 على max، لكن Claude Fable 5.1 يبقى الأول بـ 91.4 بالمئة. على الاختبار الأعلى وزنًا GDPval-AA v2، تحسنت ميتا من 1615 إلى 1709 و1754 من أصل 1000 لأداء خبراء بشريين، بينما Claude Fable 5.1 يقف عند 1853.
سجلت النسخة الجديدة تحسنات إضافية في اختبارات أخرى، لكن انخفضت في اثنين: AA-LCR هبط من 83 إلى 79 بالمئة، والدقة في AA-Omniscience تراجعت بـ 3 نقاط لأن النموذج يرفض الإجابة أكثر عندما يكون غير متأكد. لم تعلن ميتا أو Artificial Analysis بعد عن السعر الكامل للنسخة max، فيما توجد نماذج أكبر وإصدار مفتوح الأوزان في الطريق.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.