返回开发者专区官方定价 官方定价 官方定价 官方定价 官方定价 官方定价 官方定价
Microsoft 模型
探索 Microsoft 的所有 7 个模型,包括详细定价、优缺点和开发者推荐。
7
模型
$0.360
最低输入价格
262K
最大上下文
4
质量层级
快速推荐
最佳性价比: MAI-Transcribe-1.5 ($0.360/1M)
最佳质量: MAI-Image-2.5
最佳推理: MAI-Thinking-1
MAI-Thinking-1
Reasoning复杂推理、数学、智能体编码
适用场景: 适用于复杂多步推理、数学问题和智能体编码,其中准确性比原始速度更重要。
核心升级
- ◆~1T 总参数,35B 活跃 MoE — 在中重量级具有竞争力
- ◆AIME 2025: 97.0%, AIME 2026: 94.5% — 高级数学推理
- ◆SWE-bench Pro: 与 Claude Opus 4.6 竞争
- ◆比 o3 更快的首令牌延迟,适用于实时推理
- ◆干净、可追溯的企业级数据 — 无蒸馏
输入价格
$5.00
per 1M tokens
输出价格
$20.00
per 1M tokens
缓存输入
$1.00
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 262K
最大输出: 32,000 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式
优点
- 35B 活跃 / ~1T 总参数 — 在其重量级别中表现强劲
- AIME 2025: 97.0%, AIME 2026: 94.5% — 顶级数学推理
- 无蒸馏 — 从零开始在干净数据上训练
- 在盲人人类评估中优于 Sonnet 4.6
缺点
- 尚不支持视觉
- 新模型 — 独立基准测试有限
- 以 Azure 为中心的可用性
- 成本高于非推理模型
性能
输出速度~55 tok/s
速率限制3,000 RPM
多模态能力
图像输入图像输出音频输入音频输出
基准测试
AIME 2025
97.0%
AIME 2026
94.5%
GPQA Diamond
82.0%
MAI-Code-1-Flash
Lite快速智能编码,IDE集成
适用场景: 最适合在IDE环境中进行快速代码补全、内联建议和日常编码辅助。
核心升级
- ◆5B活跃参数——与Haiku相当但便宜60%
- ◆$0.75/M输入——市场上最便宜的编码模型
- ◆每个任务少60%令牌——推理高效设计
- ◆原生GitHub Copilot和VS Code集成
- ◆HumanEval: 92%+——在此规模下编码准确性高
输入价格
$0.750
per 1M tokens
输出价格
$3.00
per 1M tokens
缓存输入
$0.150
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 131K
最大输出: 16,384 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式免费层级
优点
- 每个任务比同类产品少60%的令牌
- 5B活跃参数——超低延迟
- 深度集成到GitHub Copilot和VS Code
- 比Haiku更便宜,输入$0.75/M
缺点
- 模型较小——在复杂多文件任务上较弱
- 不支持视觉
- 仅限于编码任务——非通用
- 128K上下文小于旗舰模型
性能
输出速度~150 tok/s
速率限制10,000 RPM
多模态能力
图像输入图像输出音频输入音频输出
基准测试
HumanEval
92.0%
SWE-bench Lite
55.0%
MAI-Image-2.5
Flagship企业级图像生成与编辑
适用场景: 适用于企业及Microsoft 365工作流中品牌安全、合规的图像生成与编辑。
核心升级
- ◆文本到图像与图像编辑一体化模型
- ◆Arena ELO:超越Nano Banana Pro
- ◆生成图像中文本渲染更优
- ◆企业合规:支持私有Azure部署
- ◆提供Flash变体,更便宜、更快速生成
输入价格
$5.00
per 1M tokens
输出价格
$47.00
per 1M tokens
缓存输入
—
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 8K
最大输出: 0 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式
优点
- 世界级文本到图像及图像编辑一体化模型
- 超越Nano Banana Pro Arena评分
- 企业级:支持私有Azure部署
- 图像内文本渲染清晰
缺点
- 输出成本高,每百万Token $47
- 艺术性不如Midjourney
- 以Azure为中心
- 不支持函数调用
性能
输出速度~20 tok/s
速率限制1,000 RPM
多模态能力
图像输入图像输出音频输入音频输出
基准测试
GenEval
88.0%
MAI-Image-2.5-Flash
Mid-tier快速、经济高效的图像生成
适用场景: 用于高容量图像生成,速度和成本比绝对质量更重要。
核心升级
- ◆$1.75/$15 — 比 MAI-Image-2.5 便宜 65%
- ◆针对高吞吐量生成进行了优化
- ◆提供免费套餐用于开发
- ◆与 MAI-Image-2.5 相同的模型系列
输入价格
$1.75
per 1M tokens
输出价格
$15.00
per 1M tokens
缓存输入
—
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 8K
最大输出: 0 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式免费层级
优点
- 比标准 MAI-Image-2.5 便宜得多
- 适合高吞吐量工作流的快速生成
- 在大多数提示下质量与 MAI-Image-2.5 相同
- 提供免费套餐
缺点
- 复杂多对象提示下质量较低
- 无函数调用功能
- 以 Azure 为中心
- 精细纹理细节不足
性能
输出速度~40 tok/s
速率限制5,000 RPM
多模态能力
图像输入图像输出音频输入音频输出
基准测试
GenEval
82.0%
MAI-Transcribe-1.5
Flagship企业级语音转文字、实时转录
适用场景: 用于企业会议转录、呼叫中心分析、医疗听写和多语言字幕生成。
核心升级
- ◆SOTA准确率:在英语和多语言ASR上超越Whisper Large v3
- ◆比竞品转录模型快5倍
- ◆43种语言内置领域词汇支持
- ◆说话人分离:识别谁说了什么
- ◆$0.36/小时——企业级STT的竞争性定价
输入价格
$0.360
per 1M tokens
输出价格
$0.0000
per 1M tokens
缓存输入
—
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 0
最大输出: 0 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式
优点
- 同类最佳转录准确率——ASR基准测试中的SOTA
- 比竞品模型快5倍
- 支持43种语言及领域特定术语
- 说话人分离和实时流式传输
缺点
- 专用模型——仅限转录功能
- 按音频小时计费,而非按token
- 主要依赖Azure可用性
- 无文本生成能力
性能
输出速度—
速率限制—
多模态能力
图像输入图像输出音频输入音频输出
基准测试
WER (LibriSpeech)
1.8%
WER (Common Voice)
5.2%
MAI-Voice-2
Flagship高质量TTS、语音克隆、对话式AI
适用场景: 用于客服语音机器人、无障碍工具、电子学习内容以及实时对话式AI。
核心升级
- ◆15种语言,自然韵律和语调控制
- ◆语音克隆:从短音频样本中适配
- ◆延迟低于300毫秒——适用于实时对话
- ◆内置强大的滥用防护措施
- ◆提供Flash版本,实现超低部署成本
输入价格
$2.00
per 1M tokens
输出价格
$10.00
per 1M tokens
缓存输入
—
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 0
最大输出: 0 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式
优点
- 15种语言的自然语音
- 从短音频样本进行语音克隆
- 实时对话延迟低于300毫秒
- 企业合规与Azure集成
缺点
- 专用模型——仅限语音合成
- 语音克隆需要企业级访问权限
- 克隆灵活性不如ElevenLabs
- 主要依赖Azure可用性
性能
输出速度—
速率限制—
多模态能力
图像输入图像输出音频输入音频输出
基准测试
MOS (Naturalness)
4.5/5.0
MAI-Voice-2-Flash
Mid-tier超低成本语音合成
适用场景: 适用于高容量TTS应用,成本效率比绝对语音质量更重要。
核心升级
- ◆$0.50/$2.50 — 比MAI-Voice-2便宜75%
- ◆免费套餐用于开发和测试
- ◆与MAI-Voice-2相同的15种语言覆盖
- ◆针对高吞吐量、低延迟部署进行了优化
输入价格
$0.500
per 1M tokens
输出价格
$2.50
per 1M tokens
缓存输入
—
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 0
最大输出: 0 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式免费层级
优点
- 超高效TTS,成本降低75%
- 提供免费套餐
- 与MAI-Voice-2相同的语言覆盖范围
- 低延迟,适用于实时应用
缺点
- 自然度略低于MAI-Voice-2
- Flash版本不支持语音克隆
- 专用模型——仅限语音
- 较新模型——独立评测有限
性能
输出速度—
速率限制—
多模态能力
图像输入图像输出音频输入音频输出
基准测试
MOS (Naturalness)
4.2/5.0
并排比较
| 模型 | 层级 | 输入 | 输出 | 上下文 |
|---|---|---|---|---|
| MAI-Thinking-1 | Reasoning | $5.00 | $20.00 | 262K |
| MAI-Code-1-Flash | Lite | $0.750 | $3.00 | 131K |
| MAI-Image-2.5 | Flagship | $5.00 | $47.00 | 8K |
| MAI-Image-2.5-Flash | Mid-tier | $1.75 | $15.00 | 8K |
| MAI-Transcribe-1.5 | Flagship | $0.360 | $0.0000 | 0 |
| MAI-Voice-2 | Flagship | $2.00 | $10.00 | 0 |
| MAI-Voice-2-Flash | Mid-tier | $0.500 | $2.50 | 0 |