أعلنت Z.ai عن إطلاق GLM-5.3-Flash، الذي يمثل أول نموذج متعدد الوسائط في سلسلة GLM-5 ويُعتبر من أرخص النماذج المتخصصة في البرمجة التي طورتها الشركة. يتضمن النموذج 320 مليار معامل إجمالي مع 18 مليار معامل نشط لكل رمز، ونافذة سياق تبلغ 1,048,576 رمز، وإمكانية معالجة المدخلات النصية والصورية والفيديوية، وقد تم إطلاقه برخصة MIT مع أوزاله متاحة على منصة Hugging Face.

أظهرت الاختبارات أن GLM-5.3-Flash يحقق أداءً فائقًا على GLM-5.2 في مختلف المعايير العملية بسعر يقارب العُشر. كما حقق النموذج نتائج قريبة جدًا من Claude Opus 4.8 في معايير البرمجة الداخلية للشركة. قضى النموذج أسبوعه الأول في مرحلة اختبار مجهولة تحت اسم "Ox Alpha" على منصات OpenCode و OpenRouter، وتم تقديمه بالكامل عبر رقائق ذكاء اصطناعي صينية محلية الصنع.

بنى النموذج على أساس نموذج أساسي جديد تم تدريبه على مجموعة بيانات متعددة الوسائط تضم 30 تريليون رمز. حسب تقييمات Artificial Analysis المستقلة، حقق النموذج درجة 57 على مؤشر الذكاء، مع معدل إنتاج 48.7 رمز في الثانية ووقت تأخير أول بلغ 1.52 ثانية على واجهة برمجة التطبيقات. تعتبر رؤية الحاسوب نقطة الضعف النسبية، حيث تخلف عن Gemini 3.7 Flash في اختبارات BabyVision وMVbench.

تعمل واجهة برمجة التطبيقات بأسعار تبدأ من 0.15 دولار لكل مليون رمز إدخال، و0.03 دولار للرموز المخزنة مؤقتًا، و0.50 دولار لكل مليون رمز إخراج. يتوفر النموذج لجميع مستويات خطط GLM Coding - Lite و Pro و Max - مع حصص استخدام تبلغ ثلاثة أضعاف GLM-5.3. يدعم النموذج التشغيل المحلي عبر أطر عمل متعددة منها SGLang و vLLM و TokenSpeed و KTransformers.

أشارت Z.ai إلى أن مرحلة الاختبار بأكملها اعتمدت على رقائق ذكاء اصطناعي صينية مُصنعة محليًا باستخدام محرك مخصص قائم على SGLang، مما حقق تحسنًا بمعدل 3 أضعاف في الأداء الشاملة للتقديم عبر عشرات آلاف المسرّعات.