أعلنت شركة Liquid AI عن إطلاق نموذجها الجديد للرؤية واللغة LFM2.5-VL-3B، وهو نموذج يضم 3.1 مليار بارامتر ومصمم خصيصاً للتشغيل المحلي على الأجهزة المحمولة ومواقع الويب وأجهزة سطح المكتب. يتمتع النموذج بقدرات على قراءة الشاشات الرقمية، وتحديد إحداثيات الكائنات، وتحليل المستندات والرسوم البيانية، إضافة إلى استدعاء الأدوات عبر المدخلات النصية أو المصورة.
يحقق النموذج معدل أداء بلغ 69.4 كمتوسط عبر 28 معياراً للرؤية، وهو ما يضاهي أداء نموذج InternVL-3.5-4B، ويأتي بفارق طفيف قدره 0.7 نقطة خلف نموذج Qwen3.5-4B. يعتمد التصميم على غياب آليات الاستدلال المعقدة للإجابة بشكل مباشر وتقليل زمن الاستجابة، إذ يستهلك نحو 3 جيجابايت من الذاكرة ويسجل سرعة فك تشفر تصل إلى 228 رمزاً في الثانية على معالج Apple M5 Max.
يتوفر النموذج الجديد بأربعة تنسيقات أساسية تشمل الصيغة الأصلية، وGGUF، وONNX، وMLX، ويدعم التشغيل الفوري عبر منصات مثل llama.cpp، وvLLM، وSGLang. يعتمد الهيكل اللغوي للنموذج على الإصدار LFM2.5-2.6B، بينما تستخدم وحدة الرؤية مشفر SigLIP2 NaFlex بحجم 400 مليون بارامتر للتعامل مع الدقة الأصلية للصور وسياق يصل إلى 32,768 رمزاً مع دعم 16 لغة.
خضع النموذج لمراحل تدريب مسبق شملت نحو 34 تريليون رمز ومفردات مضاعفة بلغت 128 ألف رمز لتحسين تغطية النصوص غير اللاتينية، تلتها مراحل التدريب اللاحق عبر التقطير المعرفي والتعلم التعزيزي متعدد المكافآت. وقد سجل النموذج تفوقاً ملحوظاً في اختبارات منفردة مثل RealWorldQA وTextVQA مقارنة بنماذج منافسة تفوقه حجماً.
التعليقات (0)
لا توجد تعليقات بعد. كن أول المعلّقين.