أعلنت ميتا عن إطلاق نموذج ذكاء اصطناعي جديد باسم ميوز غليمر، وهو نموذج كثيف بـ 30 مليار معامل مصمم للعمل محليًا على الأجهزة الشخصية. يجمع النموذج بين القدرات متعددة الأنماط، حيث يتعامل مع النصوص والصور والفيديوهات في إطار عمل موحد، ويأتي بترخيص مفتوح المصدر.

يتضمن النموذج مشفر رؤية متقدم بحجم ملياري معامل، مصمم على نمط معماري يشبه نماذج التحويل. يعالج مشفر الرؤية الصور والفيديوهات بآلية موحدة، حيث يحول إطارات الفيديو بمعدل إطارين في الثانية ويحد من مدة المقطع بـ 96 إطارًا قصوى. يستخدم النموذج نمط انتباه نافذة ثلاثي متبوع بطبقة انتباه كاملة، مع تطبيق استدارة موضعية ثنائية الأبعاد.

أطلقت ميتا النموذج برعاية كاملة في مكتبات تحويلات Hugging Face و llama.cpp و vLLM وخدمات الاستدلال. يتضمن النموذج أيضًا نمط فك تشفير تخميني باستخدام تقنية DFlash، وهي وحدة اختيارية توفر إنشاء محتوى أسرع مقابل استهلاك ذاكرة إضافي، وتثبت فعالية خاصة في إنشاء محتوى منظم مثل الأكواد البرمجية.

يدعم النموذج عدة حالات استخدام متقدمة منها الإجابة عن أسئلة معقدة حول الفيديوهات بدون صوت، واستدعاء الأدوات متعددة الأنماط، والكشف عن الأشياء بصيغة مفتوحة في الصور. كما يمكن ضبط النموذج باستخدام تقنيات متعددة من التدريب الموجه إلى التعلم التعزيزي المتزامن.

يتيح التصميم المحلي للنموذج حالات استخدام متقدمة مثل تحسين النموذج ذاتيًا، والعثور على إصدارات مضغوطة منه على المنصة، ونشره على خوادم الاستدلال السحابية. يمكن للنموذج فحص الأجهزة والمنصات، واختيار أو إنشاء نسخ مضغوطة، والتحقق من الوظائف الأساسية بصرية.

جاء الإطلاق برعاية شاملة لعديد من أدوات التطوير والنشر، مما يجعل ميوز غليمر متاحًا للمطورين على منصات مختلفة بما فيها أنظمة تشغيل NVIDIA و AMD و Intel.