أعلنت منصة Hugging Face عن طرح نموذج LFM2.5-VL-3B، الذي يوسع قدرات الرؤية واللغة عبر تحسينات تشمل مُشفر رؤية SigLIP2 400M NaFlex، وتدريباً مسبقاً على نحو 34 تريليون رمز مع بيانات رؤية مضاعفة بأربع مرات. كما تم توسيع المفردات إلى 128 ألفاً لدعم النصوص غير اللاتينية.

مرّ النموذج بمرحلتين للتدريب اللاحق شملتا الضبط الموجه مع تقطير المعرفة، والتعلم التعزيزي متعدد المكافآت. وقد أظهرت نتائج تقييمه تفوقاً في فئته الحجمية على مهام الصور الواقعية، وقراءة المحتوى الرقمي، واستخدام الأدوات مقارنة بنماذج أخرى.

يتميز النموذج بقدرات تشغيل محلية على الأجهزة، محققاً معدلات فك رموز عالية على معالجات مثل M5 Max وRyzen AI Max+ 395 وهاتف Galaxy S26 Ultra، مع استهلاك محدود للذاكرة لا يتجاوز 3 غيغابايت تقريبا.

يتوفر النموذج رسمياً اليوم على منصة Hugging Face مع دعم تكامل شامل لأنظمة الاستدلال مثل vLLM وllama.cpp، مما يجعله خياراً ملائماً لبيئات العمل ذات الكثافة العالية وتطبيقات الذكاء الاصطناعي على الأجهزة.