Microsoft Модели
Изучите все 7 моделей от Microsoft с подробными ценами, плюсами и минусами, а также рекомендациями для разработчиков.
Быстрые рекомендации
MAI-Thinking-1
ReasoningСложные рассуждения, математика, агентное программирование
Когда использовать: Для сложных многошаговых рассуждений, математических задач и агентного программирования, где точность важнее скорости.
Ключевые улучшения
- ◆~1T общих параметров, 35B активных MoE — конкурентоспособна в среднем весе
- ◆AIME 2025: 97,0%, AIME 2026: 94,5% — продвинутые математические рассуждения
- ◆SWE-bench Pro: конкурентоспособна с Claude Opus 4.6
- ◆Более низкая задержка первого токена, чем у o3, для рассуждений в реальном времени
- ◆Чистые, отслеживаемые данные корпоративного уровня — без дистилляции
Плюсы
- 35B активных / ~1T общих параметров — сильная модель для своего весового класса
- AIME 2025: 97,0%, AIME 2026: 94,5% — лучшие математические рассуждения
- Без дистилляции — обучена с нуля на чистых данных
- Предпочтительнее Sonnet 4.6 в слепых человеческих оценках
Минусы
- Пока нет поддержки зрения
- Новая модель — ограниченные независимые бенчмарки
- Доступность с упором на Azure
- Более высокая стоимость по сравнению с моделями без рассуждений
Производительность
Мультимодальность
Бенчмарки
MAI-Code-1-Flash
LiteБыстрое агентное кодирование, интеграция с IDE
Когда использовать: Лучше всего подходит для быстрого завершения кода, встроенных подсказок и повседневной помощи в кодировании в средах IDE.
Ключевые улучшения
- ◆5B активных параметров — сопоставимо с Haiku, но на 60% дешевле
- ◆$0,75/M входных данных — самая дешевая модель кодирования на рынке
- ◆На 60% меньше токенов на задачу — эффективный дизайн вывода
- ◆Нативная интеграция с GitHub Copilot и VS Code
- ◆HumanEval: 92%+ — высокая точность кодирования при таком размере
Плюсы
- На 60% меньше токенов на задачу по сравнению с аналогами
- 5B активных параметров — сверхнизкая задержка
- Глубокая интеграция с GitHub Copilot и VS Code
- Дешевле Haiku: $0,75/M входных данных
Минусы
- Меньшая модель — слабее в сложных многофайловых задачах
- Нет поддержки зрения
- Ограничено задачами кодирования — не универсально
- Контекст 128K меньше, чем у флагманских моделей
Производительность
Мультимодальность
Бенчмарки
MAI-Image-2.5
FlagshipКорпоративная генерация и редактирование изображений
Когда использовать: Для безопасной и соответствующей политикам генерации и редактирования изображений в корпоративных и Microsoft 365 рабочих процессах.
Ключевые улучшения
- ◆Единая модель для преобразования текста в изображение и редактирования изображений
- ◆Arena ELO: превосходит Nano Banana Pro
- ◆Превосходное отображение текста в сгенерированных изображениях
- ◆Корпоративное соответствие: частное развертывание Azure
- ◆Доступен Flash-вариант для более дешевой и быстрой генерации
Плюсы
- Мировой уровень преобразования текста в изображение и редактирования изображений в одной модели
- Превышает показатель Nano Banana Pro Arena
- Корпоративный уровень: доступно частное развертывание Azure
- Чистое отображение текста внутри изображений
Минусы
- Дорогой вывод: $47 за миллион токенов
- Не такой художественный, как Midjourney
- Ориентация на Azure
- Отсутствие вызова функций
Производительность
Мультимодальность
Бенчмарки
MAI-Image-2.5-Flash
Mid-tierБыстрая и экономичная генерация изображений
Когда использовать: Для высокообъемной генерации изображений, где скорость и стоимость важнее абсолютного качества.
Ключевые улучшения
- ◆$1.75/$15 — на 65% дешевле, чем MAI-Image-2.5
- ◆Оптимизирован для высокопроизводительной генерации
- ◆Доступен бесплатный тариф для разработки
- ◆Та же линейка моделей, что и MAI-Image-2.5
Плюсы
- Значительно дешевле стандартного MAI-Image-2.5
- Быстрая генерация для высоконагруженных рабочих процессов
- Такое же качество, как у MAI-Image-2.5 для большинства запросов
- Доступен бесплатный тариф
Минусы
- Более низкое качество на сложных запросах с несколькими объектами
- Отсутствие вызова функций
- Ориентированность на Azure
- Меньше деталей в тонких текстурах
Производительность
Мультимодальность
Бенчмарки
MAI-Transcribe-1.5
FlagshipКорпоративное распознавание речи, транскрипция в реальном времени
Когда использовать: Для корпоративной транскрипции встреч, аналитики колл-центров, медицинской диктовки и многоязычных субтитров.
Ключевые улучшения
- ◆Точность SOTA: превосходит Whisper Large v3 в английском и многоязычном ASR
- ◆В 5 раз быстрее конкурирующих моделей транскрипции
- ◆43 языка со встроенной поддержкой доменной лексики
- ◆Диаризация дикторов: определяет, кто что сказал
- ◆$0.36/час — конкурентоспособная цена для корпоративного STT
Плюсы
- Лучшая точность транскрипции в классе — SOTA на бенчмарках ASR
- В 5 раз быстрее конкурирующих моделей
- 43 языка с поддержкой доменной терминологии
- Диаризация дикторов и потоковая передача в реальном времени
Минусы
- Специализированная модель — только транскрипция
- Цена за аудио-час, а не за токены
- Доступность преимущественно в Azure
- Отсутствие возможностей генерации текста
Производительность
Мультимодальность
Бенчмарки
MAI-Voice-2
FlagshipВысококачественный TTS, клонирование голоса, разговорный ИИ
Когда использовать: Для голосовых ботов в обслуживании клиентов, инструментов доступности, контента для электронного обучения и разговорного ИИ в реальном времени.
Ключевые улучшения
- ◆15 языков с естественной просодией и контролем тона
- ◆Клонирование голоса: адаптация из коротких аудиосэмплов
- ◆Задержка менее 300 мс — пригодно для диалога в реальном времени
- ◆Встроенные надежные средства защиты от злоупотреблений
- ◆Доступна версия Flash для сверхнизкой стоимости развертывания
Плюсы
- Естественно звучащая речь на 15 языках
- Клонирование голоса из коротких аудиосэмплов
- Задержка менее 300 мс для общения в реальном времени
- Соответствие корпоративным стандартам и интеграция с Azure
Минусы
- Специализированная модель — только синтез речи
- Клонирование голоса требует корпоративного доступа
- Менее гибкое клонирование, чем у ElevenLabs
- Доступность в основном через Azure
Производительность
Мультимодальность
Бенчмарки
MAI-Voice-2-Flash
Mid-tierСинтез речи с ультранизкой стоимостью
Когда использовать: Для высокообъемных приложений TTS, где эффективность затрат важнее абсолютного качества голоса.
Ключевые улучшения
- ◆$0.50/$2.50 — на 75% дешевле, чем MAI-Voice-2
- ◆Бесплатный тариф для разработки и тестирования
- ◆Такое же покрытие 15 языков, как у MAI-Voice-2
- ◆Оптимизирован для высокопроизводительного развертывания с низкой задержкой
Плюсы
- Ультраэффективный TTS на 75% дешевле
- Бесплатный тарифный план
- Такое же языковое покрытие, как у MAI-Voice-2
- Низкая задержка для приложений реального времени
Минусы
- Несколько меньшая естественность по сравнению с MAI-Voice-2
- Нет клонирования голоса в варианте Flash
- Специализированная модель — только речь
- Новая модель — ограниченное количество независимых обзоров
Производительность
Мультимодальность
Бенчмарки
Сравнение бок о бок
| Модель | Уровень | Вход | Выход | Контекст |
|---|---|---|---|---|
| MAI-Thinking-1 | Reasoning | $5.00 | $20.00 | 262K |
| MAI-Code-1-Flash | Lite | $0.750 | $3.00 | 131K |
| MAI-Image-2.5 | Flagship | $5.00 | $47.00 | 8K |
| MAI-Image-2.5-Flash | Mid-tier | $1.75 | $15.00 | 8K |
| MAI-Transcribe-1.5 | Flagship | $0.360 | $0.0000 | 0 |
| MAI-Voice-2 | Flagship | $2.00 | $10.00 | 0 |
| MAI-Voice-2-Flash | Mid-tier | $0.500 | $2.50 | 0 |