أطلقت فريق بحثي من جامعة بيركلي وجامعة تكساس أوستن نظامًا جديدًا يحمل اسم FreeToken، يستهدف سد الفجوة بين قوة النماذج الحديثة الضخمة وإمكانيات الأجهزة الشخصية. المشكلة الأساسية لم تكن في الأجهزة ذاتها، بل في محركات التشغيل الموجودة، التي تفترض توفر مراكز بيانات بأجهزة متقدمة. يعيد FreeToken تعريف الجهاز الشخصي كمنصة استدلال موحدة ومرنة، توزع الحسابات وحالة النموذج على كل موارد الجهاز المتاحة من معالج رسومات وذاكرة وعرض نطاق ترابط.

حقق النظام نتائج مثيرة: تشغيل نموذج بـ 35 مليار معامل على جهاز محمول بذاكرة 8 غيغابايت بسرعة تفاعلية، و284 مليار معامل على حاسوب مكتبي للألعاب، و753 مليار معامل من نموذج GLM-5.2 على بطاقة رسومات محترفة واحدة. المشروع متاح بترخيص Apache-2.0 على GitHub، ونسخة سطح مكتب لـ Windows و Linux من خلال flashml.ai.

يعتمد FreeToken على تقنية Mixture-of-Experts التي تفعّل جزءًا صغيرًا فقط من المعاملات في كل خطوة. فمثلًا، نموذج DeepSeek-V4-Flash يستخدم 13 مليار معامل فقط من أصل 284 مليار في كل خطوة معالجة، مما يسمح بتخزين الأجزاء غير المستخدمة في ذاكرة الجهاز والوصول إليها عند الحاجة.

فاقت الأداء المقاييس المعروفة بفارق واضح. على بطاقة RTX 5090، حقق FreeToken سرعة تتراوح بين 77 و83 رمزًا في الثانية لنموذج Qwen3.6، و22 إلى 25 رمزًا للثانية لنموذج DeepSeek-V4-Flash، أي 1.5 إلى 2.3 مرة أسرع من الأنظمة المنافسة. وزمن الاستجابة الأول ظل دائمًا أقل من 44 ثانية، بينما احتاج البديل الأقرب إلى دقائق معدودة.

النظام موجه بشكل أساسي للمطورين الأفراد والشركات الناشئة والفرق الهندسية الصغيرة التي تتحمل فواتير عالية لاستخدام وكلاء ذكية معتمدة على السحابة. يمثل حالة استخدام قوية أيضًا في القطاعات التي تتطلب الحفاظ على البيانات محليًا كالرعاية الصحية والخدمات القانونية والدفاع والمالية.