Microsoft النماذج
استكشف جميع النماذج البالغ عددها 7 من Microsoft مع تفاصيل الأسعار والمزايا والعيوب وتوصيات المطورين.
توصيات سريعة
MAI-Thinking-1
Reasoningالاستدلال المعقد، الرياضيات، البرمجة الوكيلة
متى تستخدم: للاستدلال متعدد الخطوات المعقد، المسائل الرياضية، والبرمجة الوكيلة حيث تكون الدقة أكثر أهمية من السرعة الخام.
أبرز التحديثات
- ◆~1T إجمالي المعاملات، 35B نشط MoE — تنافسي في الوزن المتوسط
- ◆AIME 2025: 97.0%، AIME 2026: 94.5% — استدلال رياضي متقدم
- ◆SWE-bench Pro: تنافسي مع Claude Opus 4.6
- ◆زمن استجابة أول رمز أسرع من o3 للاستدلال في الوقت الفعلي
- ◆بيانات نظيفة وقابلة للتتبع على مستوى المؤسسات — لا تقطير
المزايا
- 35B نشط / ~1T إجمالي المعاملات — قوي لفئة وزنه
- AIME 2025: 97.0%، AIME 2026: 94.5% — استدلال رياضي متقدم
- لا تقطير — تم تدريبه من الصفر على بيانات نظيفة
- مفضل على Sonnet 4.6 في تقييمات بشرية عمياء
العيوب
- لا يدعم الرؤية بعد
- نموذج جديد — معايير مستقلة محدودة
- توفر مركزي على Azure
- تكلفة أعلى من النماذج غير الاستدلالية
الأداء
متعدد الوسائط
المعايير
MAI-Code-1-Flash
Liteالبرمجة السريعة الموجهة بالوكيل، التكامل مع بيئة التطوير المتكاملة
متى تستخدم: الأفضل لإكمال الكود السريع، والاقتراحات المضمنة، والمساعدة اليومية في البرمجة داخل بيئات التطوير المتكاملة.
أبرز التحديثات
- ◆5 مليارات معلمة نشطة — مماثلة لـ Haiku ولكن أرخص بنسبة 60%
- ◆0.75 دولار لكل مليون رمز إدخال — أرخص نموذج برمجة في السوق
- ◆تقليل الرموز بنسبة 60% لكل مهمة — تصميم فعال للاستدلال
- ◆تكامل أصلي مع GitHub Copilot وVS Code
- ◆HumanEval: أكثر من 92% — دقة برمجة قوية بهذا الحجم
المزايا
- تقليل الرموز بنسبة 60% لكل مهمة مقارنة بالبدائل
- 5 مليارات معلمة نشطة — زمن استجابة فائق السرعة
- مدمج بعمق في GitHub Copilot وVS Code
- أرخص من Haiku بسعر 0.75 دولار لكل مليون رمز إدخال
العيوب
- نموذج أصغر — أضعف في المهام المعقدة متعددة الملفات
- لا يدعم الرؤية
- مقتصر على مهام البرمجة — ليس للأغراض العامة
- سياق 128 ألف رمز أصغر من النماذج الرائدة
الأداء
متعدد الوسائط
المعايير
MAI-Image-2.5
Flagshipتوليد وتحرير الصور للمؤسسات
متى تستخدم: لتوليد وتحرير الصور الآمنة للعلامة التجارية والمتوافقة مع السياسات في سير عمل المؤسسات وMicrosoft 365.
أبرز التحديثات
- ◆نموذج موحد لتوليد النص إلى صورة + تحرير الصور في نموذج واحد
- ◆Arena ELO: يتجاوز Nano Banana Pro
- ◆عرض نص فائق في الصور المولدة
- ◆الامتثال للمؤسسات: نشر خاص على Azure
- ◆متغير Flash متاح لتوليد أرخص وأسرع
المزايا
- نموذج عالمي المستوى لتوليد النص إلى صورة وتحرير الصور في نموذج واحد
- يتجاوز درجة Nano Banana Pro Arena
- مستوى المؤسسات: نشر خاص على Azure متاح
- عرض نص نظيف داخل الصور
العيوب
- إخراج مكلف بمبلغ 47 دولارًا لكل مليون رمز
- ليس فنيًا مثل Midjourney
- توفر مركزي على Azure
- لا يوجد استدعاء وظائف
الأداء
متعدد الوسائط
المعايير
MAI-Image-2.5-Flash
Mid-tierتوليد صور سريع وفعال من حيث التكلفة
متى تستخدم: لتوليد الصور عالي الحجم حيث تكون السرعة والتكلفة أكثر أهمية من الجودة المطلقة.
أبرز التحديثات
- ◆1.75 دولارًا / 15 دولارًا — أرخص بنسبة 65% من MAI-Image-2.5
- ◆محسّن للتوليد عالي الإنتاجية
- ◆يتوفر مستوى مجاني للتطوير
- ◆نفس عائلة النموذج مثل MAI-Image-2.5
المزايا
- أرخص بكثير من MAI-Image-2.5 القياسي
- توليد سريع لسير العمل عالي الحجم
- نفس جودة MAI-Image-2.5 لمعظم المطالبات
- يتوفر مستوى مجاني
العيوب
- جودة أقل في المطالبات المعقدة متعددة الكائنات
- لا يوجد استدعاء وظائف
- مركز على Azure
- تفاصيل أقل في القوام الدقيق
الأداء
متعدد الوسائط
المعايير
MAI-Transcribe-1.5
Flagshipتحويل الكلام إلى نص للمؤسسات، النسخ الفوري
متى تستخدم: لنسخ اجتماعات المؤسسات، تحليلات مراكز الاتصال، الإملاء الطبي، والترجمة الفورية متعددة اللغات.
أبرز التحديثات
- ◆دقة أحدث ما توصلت إليه التكنولوجيا: يتفوق على Whisper Large v3 في التعرف التلقائي على الكلام باللغة الإنجليزية ومتعدد اللغات
- ◆أسرع 5 مرات من نماذج النسخ المنافسة
- ◆43 لغة مع دعم مفردات المجال المدمج
- ◆تحديد المتحدث: يحدد من قال ماذا
- ◆0.36 دولار/الساعة — تسعير تنافسي لتحويل الكلام إلى نص للمؤسسات
المزايا
- أفضل دقة نسخ في الفئة — أحدث ما توصلت إليه التكنولوجيا في معايير التعرف التلقائي على الكلام
- أسرع 5 مرات من النماذج المنافسة
- 43 لغة مع مصطلحات خاصة بالمجال
- تحديد المتحدث والبث الفوري
العيوب
- نموذج متخصص — النسخ فقط
- مسعّر حسب الساعة الصوتية، وليس الرموز
- التوفر المرتكز على Azure
- لا قدرات لتوليد النصوص
الأداء
متعدد الوسائط
المعايير
MAI-Voice-2
FlagshipTTS عالي الجودة، استنساخ الصوت، الذكاء الاصطناعي للمحادثة
متى تستخدم: لروبوتات الصوت لخدمة العملاء، أدوات الوصول، محتوى التعلم الإلكتروني، والذكاء الاصطناعي للمحادثة الفورية.
أبرز التحديثات
- ◆15 لغة مع نغمة طبيعية والتحكم في النبرة
- ◆استنساخ الصوت: التكيف من عينات صوتية قصيرة
- ◆زمن استجابة أقل من 300 مللي ثانية — مناسب للحوار الفوري
- ◆ضمانات قوية ضد سوء الاستخدام مدمجة
- ◆متغير Flash متاح للنشر بتكلفة منخفضة للغاية
المزايا
- كلام طبيعي الصوت عبر 15 لغة
- استنساخ الصوت من عينات صوتية قصيرة
- زمن استجابة أقل من 300 مللي ثانية للمحادثة الفورية
- الامتثال المؤسسي والتكامل مع Azure
العيوب
- نموذج متخصص — توليف الكلام فقط
- استنساخ الصوت يتطلب موافقة مؤسسية
- مرونة أقل في الاستنساخ مقارنة بـ ElevenLabs
- التوفر المرتكز على Azure
الأداء
متعدد الوسائط
المعايير
MAI-Voice-2-Flash
Mid-tierتوليف الكلام فائق التكلفة المنخفضة
متى تستخدم: لتطبيقات TTS عالية الحجم حيث تكون كفاءة التكلفة أكثر أهمية من جودة الصوت المطلقة.
أبرز التحديثات
- ◆$0.50/$2.50 — أرخص بنسبة 75% من MAI-Voice-2
- ◆مستوى مجاني للتطوير والاختبار
- ◆نفس تغطية 15 لغة مثل MAI-Voice-2
- ◆محسّن للنشر عالي الإنتاجية ومنخفض زمن الاستجابة
المزايا
- TTS فائق الكفاءة بتكلفة أقل بنسبة 75%
- يتوفر مستوى مجاني
- نفس تغطية اللغات مثل MAI-Voice-2
- زمن استجابة منخفض للتطبيقات في الوقت الفعلي
العيوب
- طبيعية أقل قليلاً من MAI-Voice-2
- لا يوجد استنساخ صوتي في إصدار Flash
- نموذج متخصص — كلام فقط
- نموذج أحدث — مراجعات مستقلة محدودة
الأداء
متعدد الوسائط
المعايير
مقارنة جنبًا إلى جنب
| النموذج | المستوى | الإدخال | الإخراج | السياق |
|---|---|---|---|---|
| MAI-Thinking-1 | Reasoning | $5.00 | $20.00 | 262K |
| MAI-Code-1-Flash | Lite | $0.750 | $3.00 | 131K |
| MAI-Image-2.5 | Flagship | $5.00 | $47.00 | 8K |
| MAI-Image-2.5-Flash | Mid-tier | $1.75 | $15.00 | 8K |
| MAI-Transcribe-1.5 | Flagship | $0.360 | $0.0000 | 0 |
| MAI-Voice-2 | Flagship | $2.00 | $10.00 | 0 |
| MAI-Voice-2-Flash | Mid-tier | $0.500 | $2.50 | 0 |