أعلنت مينيماكس عن إطلاق نموذج تحويل النصوص إلى موسيقى المسمى مينيماكس-ميوزك3، وهو نموذج مفتوح الأوزان يقبل مدخلات ثنائية تتضمن كلمات الأغنية مع علامات توضيحية للأقسام الموسيقية، وملف وصف موسيقي تفصيلي. يولد النموذج أغنية كاملة بمدة تصل إلى خمس دقائق بجودة 32 كيلوهرتز على شكل ملف صوتي ستيريو.

يعتمد الهيكل المعماري للنموذج على دمج نموذج لغة هجين يجمع بين شبكة عصبية لغوية عملاقة بـ 8 مليار معامل وأخرى محلية بـ 600 مليون معامل، مع طبقة تركيب مستمرة مبنية على تقنية مطابقة التدفق. يستخدم النموذج ثماني طبقات من التكميم المتجهي المتبقي، الأولى منها تحتوي على 16384 إدخالًا دلاليًا، بينما تحتوي الطبقات السبع المتبقية على 1024 إدخال لكل منها لترميز التفاصيل الدقيقة.

خلافًا للأساليب التقليدية، لا يعتمد النموذج على فك تشفير الرموز المنفصلة عند التركيب. بدلًا من ذلك، يدمج الحالات الخفية النهائية لكلا النموذجين اللغويين ويغذيها إلى وحدة مطابقة تدفق بـ 2.4 مليار معامل، والتي تحول البيانات إلى فضاء كامن يتم فك تشفيره بواسطة محول تدفق يحتوي على 123 مليون معامل.

جاء إطلاق النموذج مع توفير الأوزان الكاملة وأكواد الاستدلال وثلاث طرق خادم موثقة جاهزة للاستخدام الفوري. يتوفر النموذج عبر خادم مرجعي باستخدام SGLang-Omni ويعمل على وحدتي معالجة رسوميات بأنظمة CUDA، كما يدعم تشغيلًا على 24 غيغابايت من ذاكرة الوصول العشوائي وصولًا إلى 8 غيغابايت مع تقنيات تحسين الذاكرة. يتوفر أيضًا قالب أصلي عبر منصة ComfyUI باستخدام أوزان معاد حزمها بصيغ FP16 وINT8.