العودة إلى منطقة المطورين

Microsoft النماذج

استكشف جميع النماذج البالغ عددها 7 من Microsoft مع تفاصيل الأسعار والمزايا والعيوب وتوصيات المطورين.

7
النماذج
$0.360
أقل إدخال
262K
أقصى سياق
4
مستويات الجودة

توصيات سريعة

أفضل قيمة: MAI-Transcribe-1.5 ($0.360/1M)
أفضل جودة: MAI-Image-2.5
الأفضل للاستدلال: MAI-Thinking-1

MAI-Thinking-1

Reasoning

الاستدلال المعقد، الرياضيات، البرمجة الوكيلة

التسعير الرسمي

متى تستخدم: للاستدلال متعدد الخطوات المعقد، المسائل الرياضية، والبرمجة الوكيلة حيث تكون الدقة أكثر أهمية من السرعة الخام.

أبرز التحديثات

  • ~1T إجمالي المعاملات، 35B نشط MoE — تنافسي في الوزن المتوسط
  • AIME 2025: 97.0%، AIME 2026: 94.5% — استدلال رياضي متقدم
  • SWE-bench Pro: تنافسي مع Claude Opus 4.6
  • زمن استجابة أول رمز أسرع من o3 للاستدلال في الوقت الفعلي
  • بيانات نظيفة وقابلة للتتبع على مستوى المؤسسات — لا تقطير
سعر الإدخال
$5.00
per 1M tokens
سعر الإخراج
$20.00
per 1M tokens
الإدخال المخبأ
$1.00
per 1M tokens
إدخال الدفعة
per 1M tokens
نافذة السياق: 262K
أقصى إخراج: 32,000 tokens
حد المعرفة: 2026-03
الرؤيةاستدعاء الدالةالضبط الدقيقوضع JSON

المزايا

  • 35B نشط / ~1T إجمالي المعاملات — قوي لفئة وزنه
  • AIME 2025: 97.0%، AIME 2026: 94.5% — استدلال رياضي متقدم
  • لا تقطير — تم تدريبه من الصفر على بيانات نظيفة
  • مفضل على Sonnet 4.6 في تقييمات بشرية عمياء

العيوب

  • لا يدعم الرؤية بعد
  • نموذج جديد — معايير مستقلة محدودة
  • توفر مركزي على Azure
  • تكلفة أعلى من النماذج غير الاستدلالية

الأداء

سرعة الإخراج~55 tok/s
حد المعدل3,000 RPM

متعدد الوسائط

إدخال الصورةإخراج الصورةإدخال الصوتإخراج الصوت

المعايير

AIME 2025
97.0%
AIME 2026
94.5%
GPQA Diamond
82.0%

MAI-Code-1-Flash

Lite

البرمجة السريعة الموجهة بالوكيل، التكامل مع بيئة التطوير المتكاملة

التسعير الرسمي

متى تستخدم: الأفضل لإكمال الكود السريع، والاقتراحات المضمنة، والمساعدة اليومية في البرمجة داخل بيئات التطوير المتكاملة.

أبرز التحديثات

  • 5 مليارات معلمة نشطة — مماثلة لـ Haiku ولكن أرخص بنسبة 60%
  • 0.75 دولار لكل مليون رمز إدخال — أرخص نموذج برمجة في السوق
  • تقليل الرموز بنسبة 60% لكل مهمة — تصميم فعال للاستدلال
  • تكامل أصلي مع GitHub Copilot وVS Code
  • HumanEval: أكثر من 92% — دقة برمجة قوية بهذا الحجم
سعر الإدخال
$0.750
per 1M tokens
سعر الإخراج
$3.00
per 1M tokens
الإدخال المخبأ
$0.150
per 1M tokens
إدخال الدفعة
per 1M tokens
نافذة السياق: 131K
أقصى إخراج: 16,384 tokens
حد المعرفة: 2026-03
الرؤيةاستدعاء الدالةالضبط الدقيقوضع JSONالمستوى المجاني

المزايا

  • تقليل الرموز بنسبة 60% لكل مهمة مقارنة بالبدائل
  • 5 مليارات معلمة نشطة — زمن استجابة فائق السرعة
  • مدمج بعمق في GitHub Copilot وVS Code
  • أرخص من Haiku بسعر 0.75 دولار لكل مليون رمز إدخال

العيوب

  • نموذج أصغر — أضعف في المهام المعقدة متعددة الملفات
  • لا يدعم الرؤية
  • مقتصر على مهام البرمجة — ليس للأغراض العامة
  • سياق 128 ألف رمز أصغر من النماذج الرائدة

الأداء

سرعة الإخراج~150 tok/s
حد المعدل10,000 RPM

متعدد الوسائط

إدخال الصورةإخراج الصورةإدخال الصوتإخراج الصوت

المعايير

HumanEval
92.0%
SWE-bench Lite
55.0%

MAI-Image-2.5

Flagship

توليد وتحرير الصور للمؤسسات

التسعير الرسمي

متى تستخدم: لتوليد وتحرير الصور الآمنة للعلامة التجارية والمتوافقة مع السياسات في سير عمل المؤسسات وMicrosoft 365.

أبرز التحديثات

  • نموذج موحد لتوليد النص إلى صورة + تحرير الصور في نموذج واحد
  • Arena ELO: يتجاوز Nano Banana Pro
  • عرض نص فائق في الصور المولدة
  • الامتثال للمؤسسات: نشر خاص على Azure
  • متغير Flash متاح لتوليد أرخص وأسرع
سعر الإدخال
$5.00
per 1M tokens
سعر الإخراج
$47.00
per 1M tokens
الإدخال المخبأ
per 1M tokens
إدخال الدفعة
per 1M tokens
نافذة السياق: 8K
أقصى إخراج: 0 tokens
حد المعرفة: 2026-03
الرؤيةاستدعاء الدالةالضبط الدقيقوضع JSON

المزايا

  • نموذج عالمي المستوى لتوليد النص إلى صورة وتحرير الصور في نموذج واحد
  • يتجاوز درجة Nano Banana Pro Arena
  • مستوى المؤسسات: نشر خاص على Azure متاح
  • عرض نص نظيف داخل الصور

العيوب

  • إخراج مكلف بمبلغ 47 دولارًا لكل مليون رمز
  • ليس فنيًا مثل Midjourney
  • توفر مركزي على Azure
  • لا يوجد استدعاء وظائف

الأداء

سرعة الإخراج~20 tok/s
حد المعدل1,000 RPM

متعدد الوسائط

إدخال الصورةإخراج الصورةإدخال الصوتإخراج الصوت

المعايير

GenEval
88.0%

MAI-Image-2.5-Flash

Mid-tier

توليد صور سريع وفعال من حيث التكلفة

التسعير الرسمي

متى تستخدم: لتوليد الصور عالي الحجم حيث تكون السرعة والتكلفة أكثر أهمية من الجودة المطلقة.

أبرز التحديثات

  • 1.75 دولارًا / 15 دولارًا — أرخص بنسبة 65% من MAI-Image-2.5
  • محسّن للتوليد عالي الإنتاجية
  • يتوفر مستوى مجاني للتطوير
  • نفس عائلة النموذج مثل MAI-Image-2.5
سعر الإدخال
$1.75
per 1M tokens
سعر الإخراج
$15.00
per 1M tokens
الإدخال المخبأ
per 1M tokens
إدخال الدفعة
per 1M tokens
نافذة السياق: 8K
أقصى إخراج: 0 tokens
حد المعرفة: 2026-03
الرؤيةاستدعاء الدالةالضبط الدقيقوضع JSONالمستوى المجاني

المزايا

  • أرخص بكثير من MAI-Image-2.5 القياسي
  • توليد سريع لسير العمل عالي الحجم
  • نفس جودة MAI-Image-2.5 لمعظم المطالبات
  • يتوفر مستوى مجاني

العيوب

  • جودة أقل في المطالبات المعقدة متعددة الكائنات
  • لا يوجد استدعاء وظائف
  • مركز على Azure
  • تفاصيل أقل في القوام الدقيق

الأداء

سرعة الإخراج~40 tok/s
حد المعدل5,000 RPM

متعدد الوسائط

إدخال الصورةإخراج الصورةإدخال الصوتإخراج الصوت

المعايير

GenEval
82.0%

MAI-Transcribe-1.5

Flagship

تحويل الكلام إلى نص للمؤسسات، النسخ الفوري

التسعير الرسمي

متى تستخدم: لنسخ اجتماعات المؤسسات، تحليلات مراكز الاتصال، الإملاء الطبي، والترجمة الفورية متعددة اللغات.

أبرز التحديثات

  • دقة أحدث ما توصلت إليه التكنولوجيا: يتفوق على Whisper Large v3 في التعرف التلقائي على الكلام باللغة الإنجليزية ومتعدد اللغات
  • أسرع 5 مرات من نماذج النسخ المنافسة
  • 43 لغة مع دعم مفردات المجال المدمج
  • تحديد المتحدث: يحدد من قال ماذا
  • 0.36 دولار/الساعة — تسعير تنافسي لتحويل الكلام إلى نص للمؤسسات
سعر الإدخال
$0.360
per 1M tokens
سعر الإخراج
$0.0000
per 1M tokens
الإدخال المخبأ
per 1M tokens
إدخال الدفعة
per 1M tokens
نافذة السياق: 0
أقصى إخراج: 0 tokens
حد المعرفة: 2026-03
الرؤيةاستدعاء الدالةالضبط الدقيقوضع JSON

المزايا

  • أفضل دقة نسخ في الفئة — أحدث ما توصلت إليه التكنولوجيا في معايير التعرف التلقائي على الكلام
  • أسرع 5 مرات من النماذج المنافسة
  • 43 لغة مع مصطلحات خاصة بالمجال
  • تحديد المتحدث والبث الفوري

العيوب

  • نموذج متخصص — النسخ فقط
  • مسعّر حسب الساعة الصوتية، وليس الرموز
  • التوفر المرتكز على Azure
  • لا قدرات لتوليد النصوص

الأداء

سرعة الإخراج
حد المعدل

متعدد الوسائط

إدخال الصورةإخراج الصورةإدخال الصوتإخراج الصوت

المعايير

WER (LibriSpeech)
1.8%
WER (Common Voice)
5.2%

MAI-Voice-2

Flagship

TTS عالي الجودة، استنساخ الصوت، الذكاء الاصطناعي للمحادثة

التسعير الرسمي

متى تستخدم: لروبوتات الصوت لخدمة العملاء، أدوات الوصول، محتوى التعلم الإلكتروني، والذكاء الاصطناعي للمحادثة الفورية.

أبرز التحديثات

  • 15 لغة مع نغمة طبيعية والتحكم في النبرة
  • استنساخ الصوت: التكيف من عينات صوتية قصيرة
  • زمن استجابة أقل من 300 مللي ثانية — مناسب للحوار الفوري
  • ضمانات قوية ضد سوء الاستخدام مدمجة
  • متغير Flash متاح للنشر بتكلفة منخفضة للغاية
سعر الإدخال
$2.00
per 1M tokens
سعر الإخراج
$10.00
per 1M tokens
الإدخال المخبأ
per 1M tokens
إدخال الدفعة
per 1M tokens
نافذة السياق: 0
أقصى إخراج: 0 tokens
حد المعرفة: 2026-03
الرؤيةاستدعاء الدالةالضبط الدقيقوضع JSON

المزايا

  • كلام طبيعي الصوت عبر 15 لغة
  • استنساخ الصوت من عينات صوتية قصيرة
  • زمن استجابة أقل من 300 مللي ثانية للمحادثة الفورية
  • الامتثال المؤسسي والتكامل مع Azure

العيوب

  • نموذج متخصص — توليف الكلام فقط
  • استنساخ الصوت يتطلب موافقة مؤسسية
  • مرونة أقل في الاستنساخ مقارنة بـ ElevenLabs
  • التوفر المرتكز على Azure

الأداء

سرعة الإخراج
حد المعدل

متعدد الوسائط

إدخال الصورةإخراج الصورةإدخال الصوتإخراج الصوت

المعايير

MOS (Naturalness)
4.5/5.0

MAI-Voice-2-Flash

Mid-tier

توليف الكلام فائق التكلفة المنخفضة

التسعير الرسمي

متى تستخدم: لتطبيقات TTS عالية الحجم حيث تكون كفاءة التكلفة أكثر أهمية من جودة الصوت المطلقة.

أبرز التحديثات

  • $0.50/$2.50 — أرخص بنسبة 75% من MAI-Voice-2
  • مستوى مجاني للتطوير والاختبار
  • نفس تغطية 15 لغة مثل MAI-Voice-2
  • محسّن للنشر عالي الإنتاجية ومنخفض زمن الاستجابة
سعر الإدخال
$0.500
per 1M tokens
سعر الإخراج
$2.50
per 1M tokens
الإدخال المخبأ
per 1M tokens
إدخال الدفعة
per 1M tokens
نافذة السياق: 0
أقصى إخراج: 0 tokens
حد المعرفة: 2026-03
الرؤيةاستدعاء الدالةالضبط الدقيقوضع JSONالمستوى المجاني

المزايا

  • TTS فائق الكفاءة بتكلفة أقل بنسبة 75%
  • يتوفر مستوى مجاني
  • نفس تغطية اللغات مثل MAI-Voice-2
  • زمن استجابة منخفض للتطبيقات في الوقت الفعلي

العيوب

  • طبيعية أقل قليلاً من MAI-Voice-2
  • لا يوجد استنساخ صوتي في إصدار Flash
  • نموذج متخصص — كلام فقط
  • نموذج أحدث — مراجعات مستقلة محدودة

الأداء

سرعة الإخراج
حد المعدل

متعدد الوسائط

إدخال الصورةإخراج الصورةإدخال الصوتإخراج الصوت

المعايير

MOS (Naturalness)
4.2/5.0

مقارنة جنبًا إلى جنب

النموذجالمستوىالإدخالالإخراجالسياق
MAI-Thinking-1Reasoning$5.00$20.00262K
MAI-Code-1-FlashLite$0.750$3.00131K
MAI-Image-2.5Flagship$5.00$47.008K
MAI-Image-2.5-FlashMid-tier$1.75$15.008K
MAI-Transcribe-1.5Flagship$0.360$0.00000
MAI-Voice-2Flagship$2.00$10.000
MAI-Voice-2-FlashMid-tier$0.500$2.500