أعلنت كارتيسيا عن إصدار النسخة الجديدة من نموذجها الذي يحول النصوص إلى كلام في الوقت الفعلي، حيث يأتي بعد ثلاثة أشهر من الإصدار السابق. يتميز النموذج الجديد بتحسينات ملموسة في طبيعية الصوت المولد، وهو ما يعكسه ترتيبه على لوحات التقييس المستقلة.

حقق النموذج الجديد المرتبة الأولى على لوحتي تقييس Artificial Analysis، برصيد 1283 نقطة في فئة الأصوات المقدمة من الشركات و1123 نقطة في فئة الأصوات الموحدة. يكتسب الترتيب الثاني أهمية أكبر نظرًا لأنه يقيس جودة محرك الاصطناع نفسه بمعزل عن مكتبة الأصوات، حيث يتقدم Sonic-3.6 على منافسيه بفارق ملحوظ.

يعتمد النموذج على بنية الفضاء الحالتي بدلًا من المحولات التقليدية، مما يسهم في تحقيق زمن استجابة أقل من 90 ميلي ثانية. يشدد مطورو النموذج على أن الاختيارات المعمارية تسمح بتحقيق توازن بين السرعة والطبيعية دون الحاجة لبيان التضاربات كحتمية تقنية.

يتوفر النموذج حاليًا في نسخة تجريبية عبر واجهة برمجية مستضافة، إلا أن الشركة لم تطلق أوزان النموذج للاستخدام الذاتي المستضاف. يندرج المنتج ضمن نماذج مغلقة وتجارية بشكل حصري، حيث يتعين على المستخدمين استئجار الخدمة بدلًا من امتلاكها.

حددت كارتيسيا سعرًا معياريًا بواقع 49 دولارًا لكل مليون حرف، وهو نصف سعر منتج ElevenLabs Eleven v3 البالغ 100 دولار. كما توفر الشركة خطط اشتراك شهرية تبدأ من 299 دولار، وتشمل حوالي 10667 دقيقة من خدمة التحويل مع 15 طلب متزامن.