開発者ゾーンに戻る

Microsoft モデル

Microsoft の全 7 モデルを、詳細な価格、長所・短所、開発者向け推奨事項とともにご覧いただけます。

7
モデル
$0.360
最安入力
262K
最大コンテキスト
4
品質ティア

クイック推奨

ベストバリュー: MAI-Transcribe-1.5 ($0.360/1M)
最高品質: MAI-Image-2.5
推論に最適: MAI-Thinking-1

MAI-Thinking-1

Reasoning

複雑な推論、数学、エージェントコーディング

公式価格

使用するタイミング: 正確性が速度よりも重要な複雑な多段階推論、数学問題、エージェントコーディングに使用します。

アップグレードのポイント

  • ~1T総パラメータ、35BアクティブMoE — ミッドウェイトで競争力あり
  • AIME 2025: 97.0%、AIME 2026: 94.5% — 高度な数学推論
  • SWE-bench Pro: Claude Opus 4.6と競争力あり
  • リアルタイム推論のためのo3より速い初回トークンレイテンシ
  • クリーンでトレーサブルなエンタープライズグレードデータ — 蒸留なし
入力価格
$5.00
per 1M tokens
出力価格
$20.00
per 1M tokens
キャッシュ入力
$1.00
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 262K
最大出力: 32,000 tokens
知識のカットオフ: 2026-03
ビジョン関数呼び出しファインチューニングJSONモード

長所

  • 35Bアクティブ / ~1T総パラメータ — 同クラスで強力
  • AIME 2025: 97.0%、AIME 2026: 94.5% — トップクラスの数学推論
  • 蒸留なし — クリーンデータでゼロから学習
  • ブラインド人間評価でSonnet 4.6よりも好まれる

短所

  • ビジョンサポート未対応
  • 新モデル — 限定的な独立ベンチマーク
  • Azure中心の可用性
  • 非推論モデルより高いコスト

パフォーマンス

出力速度~55 tok/s
レート制限3,000 RPM

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

AIME 2025
97.0%
AIME 2026
94.5%
GPQA Diamond
82.0%

MAI-Code-1-Flash

Lite

高速エージェントコーディング、IDE統合

公式価格

使用するタイミング: IDE環境での高速コード補完、インライン提案、日常的なコーディング支援に最適です。

アップグレードのポイント

  • 5Bアクティブパラメータ — Haikuと同等だが60%安価
  • $0.75/M入力 — 市場で最も安価なコーディングモデル
  • タスクあたり60%少ないトークン — 推論効率の良い設計
  • ネイティブGitHub CopilotおよびVS Code統合
  • HumanEval: 92%+ — このサイズで強力なコーディング精度
入力価格
$0.750
per 1M tokens
出力価格
$3.00
per 1M tokens
キャッシュ入力
$0.150
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 131K
最大出力: 16,384 tokens
知識のカットオフ: 2026-03
ビジョン関数呼び出しファインチューニングJSONモード無料ティア

長所

  • 代替手段と比較してタスクあたり60%少ないトークン
  • 5Bアクティブパラメータ — 超低レイテンシ
  • GitHub CopilotおよびVS Codeに深く統合
  • Haikuより安価な$0.75/M入力

短所

  • 小型モデル — 複雑なマルチファイルタスクに弱い
  • ビジョンサポートなし
  • コーディングタスクに限定 — 汎用ではない
  • 128Kコンテキストはフラッグシップモデルより小さい

パフォーマンス

出力速度~150 tok/s
レート制限10,000 RPM

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

HumanEval
92.0%
SWE-bench Lite
55.0%

MAI-Image-2.5

Flagship

エンタープライズ向け画像生成・編集

公式価格

使用するタイミング: ブランドセーフでポリシー準拠の画像生成・編集を、エンタープライズおよびMicrosoft 365ワークフローで実現します。

アップグレードのポイント

  • テキストから画像への変換 + 画像編集を1つのモデルに統合
  • Arena ELO:Nano Banana Proを上回る
  • 生成画像における優れたテキストレンダリング
  • エンタープライズコンプライアンス:プライベートAzureデプロイメント
  • より安価で高速な生成を実現するFlashバリアント
入力価格
$5.00
per 1M tokens
出力価格
$47.00
per 1M tokens
キャッシュ入力
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 8K
最大出力: 0 tokens
知識のカットオフ: 2026-03
ビジョン関数呼び出しファインチューニングJSONモード

長所

  • テキストから画像への変換と画像編集を1つのモデルで実現するワールドクラス
  • Nano Banana Pro Arenaスコアを上回る
  • エンタープライズグレード:プライベートAzureデプロイメント対応
  • 画像内のクリーンなテキストレンダリング

短所

  • トークンあたり$47と高価な出力
  • Midjourneyほど芸術的ではない
  • Azure中心の可用性
  • 関数呼び出しなし

パフォーマンス

出力速度~20 tok/s
レート制限1,000 RPM

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

GenEval
88.0%

MAI-Image-2.5-Flash

Mid-tier

高速でコスト効率の高い画像生成

公式価格

使用するタイミング: 絶対的な品質よりも速度とコストが重要な大量画像生成に使用します。

アップグレードのポイント

  • $1.75/$15 — MAI-Image-2.5より65%低コスト
  • 高スループット生成に最適化
  • 開発用無料ティアあり
  • MAI-Image-2.5と同じモデルファミリー
入力価格
$1.75
per 1M tokens
出力価格
$15.00
per 1M tokens
キャッシュ入力
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 8K
最大出力: 0 tokens
知識のカットオフ: 2026-03
ビジョン関数呼び出しファインチューニングJSONモード無料ティア

長所

  • 標準のMAI-Image-2.5よりもはるかに低コスト
  • 大量ワークフロー向けの高速生成
  • ほとんどのプロンプトでMAI-Image-2.5と同じ品質
  • 無料ティアあり

短所

  • 複雑なマルチオブジェクトプロンプトでの品質低下
  • 関数呼び出しなし
  • Azure中心
  • 微細なテクスチャの詳細不足

パフォーマンス

出力速度~40 tok/s
レート制限5,000 RPM

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

GenEval
82.0%

MAI-Transcribe-1.5

Flagship

エンタープライズ音声テキスト変換、リアルタイム文字起こし

公式価格

使用するタイミング: エンタープライズ会議の文字起こし、コールセンター分析、医療用ディクテーション、多言語キャプション作成に使用します。

アップグレードのポイント

  • SOTA精度: 英語および多言語ASRでWhisper Large v3を凌駕
  • 競合の文字起こしモデルより5倍高速
  • 内蔵ドメイン語彙サポートを含む43言語
  • 話者分離: 誰が何を言ったかを識別
  • 時間あたり$0.36 — エンタープライズSTT向け競争力のある価格
入力価格
$0.360
per 1M tokens
出力価格
$0.0000
per 1M tokens
キャッシュ入力
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 0
最大出力: 0 tokens
知識のカットオフ: 2026-03
ビジョン関数呼び出しファインチューニングJSONモード

長所

  • クラス最高の文字起こし精度 — ASRベンチマークでSOTA
  • 競合モデルより5倍高速
  • ドメイン固有用語を含む43言語対応
  • 話者分離とリアルタイムストリーミング対応

短所

  • 特化型モデル — 文字起こしのみ
  • トークンではなくオーディオ時間単位の課金
  • Azure中心の可用性
  • テキスト生成機能なし

パフォーマンス

出力速度
レート制限

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

WER (LibriSpeech)
1.8%
WER (Common Voice)
5.2%

MAI-Voice-2

Flagship

高品質TTS、音声クローン、会話型AI

公式価格

使用するタイミング: カスタマーサービスの音声ボット、アクセシビリティツール、eラーニングコンテンツ、リアルタイム会話型AIに使用します。

アップグレードのポイント

  • 自然な韻律とトーン制御が可能な15言語
  • 音声クローン: 短い音声サンプルから適応
  • 300ms未満のレイテンシ — リアルタイム対話に適切
  • 強力な悪用防止策が組み込まれている
  • 超低コスト展開のためのFlashバリアントを提供
入力価格
$2.00
per 1M tokens
出力価格
$10.00
per 1M tokens
キャッシュ入力
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 0
最大出力: 0 tokens
知識のカットオフ: 2026-03
ビジョン関数呼び出しファインチューニングJSONモード

長所

  • 15言語にわたる自然な音声
  • 短い音声サンプルからの音声クローン
  • リアルタイム会話のための300ms未満のレイテンシ
  • エンタープライズコンプライアンスとAzure統合

短所

  • 特化型モデル — 音声合成のみ
  • 音声クローンにはエンタープライズゲーティングが必要
  • ElevenLabsよりも柔軟性の低いクローン
  • Azure中心の可用性

パフォーマンス

出力速度
レート制限

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

MOS (Naturalness)
4.5/5.0

MAI-Voice-2-Flash

Mid-tier

超低コスト音声合成

公式価格

使用するタイミング: 音質よりもコスト効率が重要な大量TTSアプリケーション向け。

アップグレードのポイント

  • $0.50/$2.50 — MAI-Voice-2より75%安い
  • 開発・テスト用の無料ティア
  • MAI-Voice-2と同じ15言語カバレッジ
  • 高スループット・低レイテンシ展開に最適化
入力価格
$0.500
per 1M tokens
出力価格
$2.50
per 1M tokens
キャッシュ入力
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 0
最大出力: 0 tokens
知識のカットオフ: 2026-03
ビジョン関数呼び出しファインチューニングJSONモード無料ティア

長所

  • 75%低コストの超効率的TTS
  • 無料ティアあり
  • MAI-Voice-2と同じ言語カバレッジ
  • リアルタイムアプリケーション向けの低レイテンシ

短所

  • MAI-Voice-2よりやや自然さが劣る
  • Flashバリアントでは音声クローン不可
  • 専門モデル — 音声のみ
  • 新モデル — 独立したレビューが限定的

パフォーマンス

出力速度
レート制限

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

MOS (Naturalness)
4.2/5.0

並べて比較

モデルティア入力出力コンテキスト
MAI-Thinking-1Reasoning$5.00$20.00262K
MAI-Code-1-FlashLite$0.750$3.00131K
MAI-Image-2.5Flagship$5.00$47.008K
MAI-Image-2.5-FlashMid-tier$1.75$15.008K
MAI-Transcribe-1.5Flagship$0.360$0.00000
MAI-Voice-2Flagship$2.00$10.000
MAI-Voice-2-FlashMid-tier$0.500$2.500