مايكروسوفت تكشف عن MAI-Image-2.5-Pro وMAI-Voice-2-Flash لتعزيز جودة الصور وسرعة المحادثات المؤسسية

بعد الكشف عن MAI-Image-2.5 في مايو، أعلنت مايكروسوفت عن نموذجين جديدين: MAI-Image-2.5-Pro و MAI-Voice-2-Flash، مصمّمين لدفع تجربة توليد الصور إلى مستوى أبعد وتوفير خبرات صوتية مؤسسية سريعة.

تزعم الشركة أن هذين النموذجين يعمَلان حالياً في ملايين التجارب عبر Bing وPowerPoint وOneDrive وDynamics 365 وAzure.
ما يقدمه كل نموذج

MAI-Image-2.5-Pro هو الأعلى جودة حتى الآن في توليد الصور لدى مايكروسوفت، ويركز على إنتاج رسومات مفصلة ونص داخل الصور بدقة، مع تحسين تحرير الصور باستخدام أوامر بلغةطبيعية.
MAI-Voice-2-Flash هو نموذج صوت منخفض الوزن مخصص للمحادثات منخفضة الكمون، ويقول إنه يوفر جودة الكلام الطبيعية نفسها كـ MAI-Voice-2، مع تشغيل أسرع بنحو ضعف وتكلفة أقل بنحو 32%.
التوفر والاستخدام في المنتجات وشبح القيود
كلا النموذجين متاحان حالياً ضمن معاينة عامة، ما يمنح المطورين خياراً بين الجودة والسرعة والتكلفة بحسب أعباء العمل.
التأثير في تطبيقات مايكروسوفت
يذكر أن Bing Image Creator يعمل الآن كلياً باستخدام MAI-Image-2.5، محوّلاً الاعتماد على نماذج خارجية إلى تقنيتها الخاصة. كما تستخدم PowerPoint MAI-Image-2.5 في تحرير الصور، مما أدى إلى تقليل تكاليف GPU بما يصل إلى 84% مقارنةً بـ GPT-Image-2.
أما في OneDrive، فذكر أن النموذج حسّن معدلات الحفظ بنسبة 26% وتقلص الكمون بنحو 25% وزادت الكفاءة بمقدار 2.5 مرة.
مکاسب إضافية ونطاقات الاستخدام
على صعيد الصوت، يعمل MAI-Voice-2-Flash الآن وراء Dynamics 365 Contact Center وAzure Voice Live، مما يساعد الشركات على بناء وكلاء صوتيين أكثر استجابة، مع خفض تكاليف GPU حتى 89%.
وأعلنت مايكروسوفت أيضاً أن Dragon Copilot يستخدم MAI-Transcribe-1.5 عبر 58 لغة، ما يسهم بشكل ملحوظ في تقليل أخطاء النقل والتعرّف على اللغة في قطاع الرعاية الصحية.





