返回开发者专区

Microsoft 模型

探索 Microsoft 的所有 7 个模型,包括详细定价、优缺点和开发者推荐。

7
模型
$0.360
最低输入价格
262K
最大上下文
4
质量层级

快速推荐

最佳性价比: MAI-Transcribe-1.5 ($0.360/1M)
最佳质量: MAI-Image-2.5
最佳推理: MAI-Thinking-1

MAI-Thinking-1

Reasoning

复杂推理、数学、智能体编码

官方定价

适用场景: 适用于复杂多步推理、数学问题和智能体编码,其中准确性比原始速度更重要。

核心升级

  • ~1T 总参数,35B 活跃 MoE — 在中重量级具有竞争力
  • AIME 2025: 97.0%, AIME 2026: 94.5% — 高级数学推理
  • SWE-bench Pro: 与 Claude Opus 4.6 竞争
  • 比 o3 更快的首令牌延迟,适用于实时推理
  • 干净、可追溯的企业级数据 — 无蒸馏
输入价格
$5.00
per 1M tokens
输出价格
$20.00
per 1M tokens
缓存输入
$1.00
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 262K
最大输出: 32,000 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式

优点

  • 35B 活跃 / ~1T 总参数 — 在其重量级别中表现强劲
  • AIME 2025: 97.0%, AIME 2026: 94.5% — 顶级数学推理
  • 无蒸馏 — 从零开始在干净数据上训练
  • 在盲人人类评估中优于 Sonnet 4.6

缺点

  • 尚不支持视觉
  • 新模型 — 独立基准测试有限
  • 以 Azure 为中心的可用性
  • 成本高于非推理模型

性能

输出速度~55 tok/s
速率限制3,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

AIME 2025
97.0%
AIME 2026
94.5%
GPQA Diamond
82.0%

MAI-Code-1-Flash

Lite

快速智能编码,IDE集成

官方定价

适用场景: 最适合在IDE环境中进行快速代码补全、内联建议和日常编码辅助。

核心升级

  • 5B活跃参数——与Haiku相当但便宜60%
  • $0.75/M输入——市场上最便宜的编码模型
  • 每个任务少60%令牌——推理高效设计
  • 原生GitHub Copilot和VS Code集成
  • HumanEval: 92%+——在此规模下编码准确性高
输入价格
$0.750
per 1M tokens
输出价格
$3.00
per 1M tokens
缓存输入
$0.150
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 131K
最大输出: 16,384 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式免费层级

优点

  • 每个任务比同类产品少60%的令牌
  • 5B活跃参数——超低延迟
  • 深度集成到GitHub Copilot和VS Code
  • 比Haiku更便宜,输入$0.75/M

缺点

  • 模型较小——在复杂多文件任务上较弱
  • 不支持视觉
  • 仅限于编码任务——非通用
  • 128K上下文小于旗舰模型

性能

输出速度~150 tok/s
速率限制10,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

HumanEval
92.0%
SWE-bench Lite
55.0%

MAI-Image-2.5

Flagship

企业级图像生成与编辑

官方定价

适用场景: 适用于企业及Microsoft 365工作流中品牌安全、合规的图像生成与编辑。

核心升级

  • 文本到图像与图像编辑一体化模型
  • Arena ELO:超越Nano Banana Pro
  • 生成图像中文本渲染更优
  • 企业合规:支持私有Azure部署
  • 提供Flash变体,更便宜、更快速生成
输入价格
$5.00
per 1M tokens
输出价格
$47.00
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 8K
最大输出: 0 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式

优点

  • 世界级文本到图像及图像编辑一体化模型
  • 超越Nano Banana Pro Arena评分
  • 企业级:支持私有Azure部署
  • 图像内文本渲染清晰

缺点

  • 输出成本高,每百万Token $47
  • 艺术性不如Midjourney
  • 以Azure为中心
  • 不支持函数调用

性能

输出速度~20 tok/s
速率限制1,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

GenEval
88.0%

MAI-Image-2.5-Flash

Mid-tier

快速、经济高效的图像生成

官方定价

适用场景: 用于高容量图像生成,速度和成本比绝对质量更重要。

核心升级

  • $1.75/$15 — 比 MAI-Image-2.5 便宜 65%
  • 针对高吞吐量生成进行了优化
  • 提供免费套餐用于开发
  • 与 MAI-Image-2.5 相同的模型系列
输入价格
$1.75
per 1M tokens
输出价格
$15.00
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 8K
最大输出: 0 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式免费层级

优点

  • 比标准 MAI-Image-2.5 便宜得多
  • 适合高吞吐量工作流的快速生成
  • 在大多数提示下质量与 MAI-Image-2.5 相同
  • 提供免费套餐

缺点

  • 复杂多对象提示下质量较低
  • 无函数调用功能
  • 以 Azure 为中心
  • 精细纹理细节不足

性能

输出速度~40 tok/s
速率限制5,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

GenEval
82.0%

MAI-Transcribe-1.5

Flagship

企业级语音转文字、实时转录

官方定价

适用场景: 用于企业会议转录、呼叫中心分析、医疗听写和多语言字幕生成。

核心升级

  • SOTA准确率:在英语和多语言ASR上超越Whisper Large v3
  • 比竞品转录模型快5倍
  • 43种语言内置领域词汇支持
  • 说话人分离:识别谁说了什么
  • $0.36/小时——企业级STT的竞争性定价
输入价格
$0.360
per 1M tokens
输出价格
$0.0000
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 0
最大输出: 0 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式

优点

  • 同类最佳转录准确率——ASR基准测试中的SOTA
  • 比竞品模型快5倍
  • 支持43种语言及领域特定术语
  • 说话人分离和实时流式传输

缺点

  • 专用模型——仅限转录功能
  • 按音频小时计费,而非按token
  • 主要依赖Azure可用性
  • 无文本生成能力

性能

输出速度
速率限制

多模态能力

图像输入图像输出音频输入音频输出

基准测试

WER (LibriSpeech)
1.8%
WER (Common Voice)
5.2%

MAI-Voice-2

Flagship

高质量TTS、语音克隆、对话式AI

官方定价

适用场景: 用于客服语音机器人、无障碍工具、电子学习内容以及实时对话式AI。

核心升级

  • 15种语言,自然韵律和语调控制
  • 语音克隆:从短音频样本中适配
  • 延迟低于300毫秒——适用于实时对话
  • 内置强大的滥用防护措施
  • 提供Flash版本,实现超低部署成本
输入价格
$2.00
per 1M tokens
输出价格
$10.00
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 0
最大输出: 0 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式

优点

  • 15种语言的自然语音
  • 从短音频样本进行语音克隆
  • 实时对话延迟低于300毫秒
  • 企业合规与Azure集成

缺点

  • 专用模型——仅限语音合成
  • 语音克隆需要企业级访问权限
  • 克隆灵活性不如ElevenLabs
  • 主要依赖Azure可用性

性能

输出速度
速率限制

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MOS (Naturalness)
4.5/5.0

MAI-Voice-2-Flash

Mid-tier

超低成本语音合成

官方定价

适用场景: 适用于高容量TTS应用,成本效率比绝对语音质量更重要。

核心升级

  • $0.50/$2.50 — 比MAI-Voice-2便宜75%
  • 免费套餐用于开发和测试
  • 与MAI-Voice-2相同的15种语言覆盖
  • 针对高吞吐量、低延迟部署进行了优化
输入价格
$0.500
per 1M tokens
输出价格
$2.50
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 0
最大输出: 0 tokens
知识截止日期: 2026-03
视觉函数调用微调JSON 模式免费层级

优点

  • 超高效TTS,成本降低75%
  • 提供免费套餐
  • 与MAI-Voice-2相同的语言覆盖范围
  • 低延迟,适用于实时应用

缺点

  • 自然度略低于MAI-Voice-2
  • Flash版本不支持语音克隆
  • 专用模型——仅限语音
  • 较新模型——独立评测有限

性能

输出速度
速率限制

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MOS (Naturalness)
4.2/5.0

并排比较

模型层级输入输出上下文
MAI-Thinking-1Reasoning$5.00$20.00262K
MAI-Code-1-FlashLite$0.750$3.00131K
MAI-Image-2.5Flagship$5.00$47.008K
MAI-Image-2.5-FlashMid-tier$1.75$15.008K
MAI-Transcribe-1.5Flagship$0.360$0.00000
MAI-Voice-2Flagship$2.00$10.000
MAI-Voice-2-FlashMid-tier$0.500$2.500