Retour à l'espace développeur

Microsoft Modèles

Explorez les 7 modèles de Microsoft avec des prix détaillés, avantages et inconvénients, et recommandations pour développeurs.

7
Modèles
$0.360
Entrée la moins chère
262K
Contexte max
4
Niveaux de qualité

Recommandations rapides

Meilleur rapport qualité-prix: MAI-Transcribe-1.5 ($0.360/1M)
Meilleure qualité: MAI-Image-2.5
Meilleur pour le raisonnement: MAI-Thinking-1

MAI-Thinking-1

Reasoning

Raisonnement complexe, mathématiques, codage agentique

Tarifs officiels

Quand l'utiliser: Pour le raisonnement complexe en plusieurs étapes, les problèmes mathématiques et le codage agentique où la précision prime sur la vitesse brute.

Points clés de la mise à niveau

  • ~1T paramètres totaux, 35B actifs MoE — compétitif en catégorie moyenne
  • AIME 2025 : 97,0 %, AIME 2026 : 94,5 % — raisonnement mathématique avancé
  • SWE-bench Pro : compétitif avec Claude Opus 4.6
  • Latence de premier token plus rapide que o3 pour le raisonnement en temps réel
  • Données propres et traçables de qualité entreprise — pas de distillation
Prix d'entrée
$5.00
per 1M tokens
Prix de sortie
$20.00
per 1M tokens
Entrée en cache
$1.00
per 1M tokens
Entrée batch
per 1M tokens
Fenêtre de contexte: 262K
Sortie max: 32,000 tokens
Date de coupure des connaissances: 2026-03
VisionAppel de fonctionAjustement finMode JSON

Avantages

  • 35B actifs / ~1T paramètres totaux — performant pour sa catégorie
  • AIME 2025 : 97,0 %, AIME 2026 : 94,5 % — meilleur raisonnement mathématique
  • Pas de distillation — entraîné à partir de zéro sur des données propres
  • Préféré à Sonnet 4.6 dans les évaluations humaines en aveugle

Inconvénients

  • Pas encore de support visuel
  • Nouveau modèle — benchmarks indépendants limités
  • Disponibilité centrée sur Azure
  • Coût plus élevé que les modèles non raisonnants

Performance

Vitesse de sortie~55 tok/s
Limite de débit3,000 RPM

Multimodal

Entrée imageSortie imageEntrée audioSortie audio

Benchmarks

AIME 2025
97.0%
AIME 2026
94.5%
GPQA Diamond
82.0%

MAI-Code-1-Flash

Lite

Codage agentique rapide, intégration IDE

Tarifs officiels

Quand l'utiliser: Idéal pour la complétion rapide de code, les suggestions en ligne et l'assistance quotidienne au codage dans les environnements IDE.

Points clés de la mise à niveau

  • 5B paramètres actifs — comparable à Haiku mais 60 % moins cher
  • 0,75 $/M d'entrée — modèle de codage le moins cher du marché
  • 60 % de tokens en moins par tâche — conception efficace pour l'inférence
  • Intégration native GitHub Copilot et VS Code
  • HumanEval : 92 %+ — forte précision de codage à cette taille
Prix d'entrée
$0.750
per 1M tokens
Prix de sortie
$3.00
per 1M tokens
Entrée en cache
$0.150
per 1M tokens
Entrée batch
per 1M tokens
Fenêtre de contexte: 131K
Sortie max: 16,384 tokens
Date de coupure des connaissances: 2026-03
VisionAppel de fonctionAjustement finMode JSONNiveau gratuit

Avantages

  • 60 % de tokens en moins par tâche par rapport aux alternatives
  • 5B paramètres actifs — latence ultra-faible
  • Profondément intégré dans GitHub Copilot et VS Code
  • Moins cher que Haiku à 0,75 $/M d'entrée

Inconvénients

  • Modèle plus petit — plus faible sur les tâches multi-fichiers complexes
  • Pas de support visuel
  • Limité aux tâches de codage — pas à usage général
  • Contexte 128K plus petit que les modèles phares

Performance

Vitesse de sortie~150 tok/s
Limite de débit10,000 RPM

Multimodal

Entrée imageSortie imageEntrée audioSortie audio

Benchmarks

HumanEval
92.0%
SWE-bench Lite
55.0%

MAI-Image-2.5

Flagship

Génération et édition d'images pour entreprises

Tarifs officiels

Quand l'utiliser: Pour la génération et l'édition d'images conformes aux politiques et sécurisées pour les marques dans les workflows d'entreprise et Microsoft 365.

Points clés de la mise à niveau

  • Modèle unifié texte-image + édition d'images en un seul modèle
  • ELO Arena : dépasse Nano Banana Pro
  • Rendu de texte supérieur dans les images générées
  • Conformité entreprise : déploiement privé Azure
  • Variante Flash disponible pour une génération moins chère et plus rapide
Prix d'entrée
$5.00
per 1M tokens
Prix de sortie
$47.00
per 1M tokens
Entrée en cache
per 1M tokens
Entrée batch
per 1M tokens
Fenêtre de contexte: 8K
Sortie max: 0 tokens
Date de coupure des connaissances: 2026-03
VisionAppel de fonctionAjustement finMode JSON

Avantages

  • Modèle de classe mondiale pour la génération texte-image et l'édition d'images
  • Dépasse le score Nano Banana Pro Arena
  • Niveau entreprise : déploiement privé Azure disponible
  • Rendu de texte propre dans les images

Inconvénients

  • Sortie coûteuse à 47 $/M tokens
  • Moins artistique que Midjourney
  • Disponibilité centrée sur Azure
  • Pas d'appel de fonction

Performance

Vitesse de sortie~20 tok/s
Limite de débit1,000 RPM

Multimodal

Entrée imageSortie imageEntrée audioSortie audio

Benchmarks

GenEval
88.0%

MAI-Image-2.5-Flash

Mid-tier

Génération d'images rapide et économique

Tarifs officiels

Quand l'utiliser: Pour la génération d'images à volume élevé où la vitesse et le coût importent plus que la qualité absolue.

Points clés de la mise à niveau

  • 1,75 $/15 $ — 65 % moins cher que MAI-Image-2.5
  • Optimisé pour la génération à haut débit
  • Niveau gratuit disponible pour le développement
  • Même famille de modèles que MAI-Image-2.5
Prix d'entrée
$1.75
per 1M tokens
Prix de sortie
$15.00
per 1M tokens
Entrée en cache
per 1M tokens
Entrée batch
per 1M tokens
Fenêtre de contexte: 8K
Sortie max: 0 tokens
Date de coupure des connaissances: 2026-03
VisionAppel de fonctionAjustement finMode JSONNiveau gratuit

Avantages

  • Beaucoup moins cher que le MAI-Image-2.5 standard
  • Génération rapide pour les flux de travail à volume élevé
  • Même qualité que MAI-Image-2.5 pour la plupart des invites
  • Niveau gratuit disponible

Inconvénients

  • Qualité inférieure sur les invites complexes à plusieurs objets
  • Pas d'appel de fonction
  • Centré sur Azure
  • Moins de détails dans les textures fines

Performance

Vitesse de sortie~40 tok/s
Limite de débit5,000 RPM

Multimodal

Entrée imageSortie imageEntrée audioSortie audio

Benchmarks

GenEval
82.0%

MAI-Transcribe-1.5

Flagship

Transcription vocale d'entreprise, transcription en temps réel

Tarifs officiels

Quand l'utiliser: Pour la transcription de réunions d'entreprise, l'analyse des centres d'appels, la dictée médicale et le sous-titrage multilingue.

Points clés de la mise à niveau

  • Précision SOTA : surpasse Whisper Large v3 en anglais et en ASR multilingue
  • 5 fois plus rapide que les modèles de transcription concurrents
  • 43 langues avec prise en charge intégrée du vocabulaire domaine
  • Diarisation des locuteurs : identifie qui a dit quoi
  • 0,36 $/heure — tarification compétitive pour la STT d'entreprise
Prix d'entrée
$0.360
per 1M tokens
Prix de sortie
$0.0000
per 1M tokens
Entrée en cache
per 1M tokens
Entrée batch
per 1M tokens
Fenêtre de contexte: 0
Sortie max: 0 tokens
Date de coupure des connaissances: 2026-03
VisionAppel de fonctionAjustement finMode JSON

Avantages

  • Meilleure précision de transcription de sa catégorie — SOTA sur les benchmarks ASR
  • 5 fois plus rapide que les modèles concurrents
  • 43 langues avec terminologie spécifique au domaine
  • Diarisation des locuteurs et streaming en temps réel

Inconvénients

  • Modèle spécialisé — transcription uniquement
  • Facturé à l'heure audio, pas aux tokens
  • Disponibilité centrée sur Azure
  • Aucune capacité de génération de texte

Performance

Vitesse de sortie
Limite de débit

Multimodal

Entrée imageSortie imageEntrée audioSortie audio

Benchmarks

WER (LibriSpeech)
1.8%
WER (Common Voice)
5.2%

MAI-Voice-2

Flagship

TTS de haute qualité, clonage vocal, IA conversationnelle

Tarifs officiels

Quand l'utiliser: Pour les bots vocaux de service client, les outils d'accessibilité, le contenu e-learning et l'IA conversationnelle en temps réel.

Points clés de la mise à niveau

  • 15 langues avec prosodie naturelle et contrôle du ton
  • Clonage vocal : adaptation à partir de courts échantillons audio
  • Latence inférieure à 300 ms — viable pour le dialogue en temps réel
  • Mesures de protection solides intégrées
  • Variante Flash disponible pour un déploiement à très faible coût
Prix d'entrée
$2.00
per 1M tokens
Prix de sortie
$10.00
per 1M tokens
Entrée en cache
per 1M tokens
Entrée batch
per 1M tokens
Fenêtre de contexte: 0
Sortie max: 0 tokens
Date de coupure des connaissances: 2026-03
VisionAppel de fonctionAjustement finMode JSON

Avantages

  • Parole naturelle dans 15 langues
  • Clonage vocal à partir de courts échantillons audio
  • Latence inférieure à 300 ms pour la conversation en temps réel
  • Conformité entreprise et intégration Azure

Inconvénients

  • Modèle spécialisé — synthèse vocale uniquement
  • Le clonage vocal nécessite une autorisation entreprise
  • Clonage moins flexible que ElevenLabs
  • Disponibilité centrée sur Azure

Performance

Vitesse de sortie
Limite de débit

Multimodal

Entrée imageSortie imageEntrée audioSortie audio

Benchmarks

MOS (Naturalness)
4.5/5.0

MAI-Voice-2-Flash

Mid-tier

Synthèse vocale ultra-économique

Tarifs officiels

Quand l'utiliser: Pour les applications TTS à volume élevé où l'efficacité des coûts prime sur la qualité vocale absolue.

Points clés de la mise à niveau

  • 0,50 $ / 2,50 $ — 75 % moins cher que MAI-Voice-2
  • Niveau gratuit pour le développement et les tests
  • Même couverture de 15 langues que MAI-Voice-2
  • Optimisé pour un déploiement à haut débit et faible latence
Prix d'entrée
$0.500
per 1M tokens
Prix de sortie
$2.50
per 1M tokens
Entrée en cache
per 1M tokens
Entrée batch
per 1M tokens
Fenêtre de contexte: 0
Sortie max: 0 tokens
Date de coupure des connaissances: 2026-03
VisionAppel de fonctionAjustement finMode JSONNiveau gratuit

Avantages

  • TTS ultra-efficace à 75% de coût en moins
  • Niveau gratuit disponible
  • Même couverture linguistique que MAI-Voice-2
  • Faible latence pour les applications en temps réel

Inconvénients

  • Naturalité légèrement inférieure à MAI-Voice-2
  • Pas de clonage vocal dans la variante Flash
  • Modèle spécialisé — parole uniquement
  • Modèle plus récent — avis indépendants limités

Performance

Vitesse de sortie
Limite de débit

Multimodal

Entrée imageSortie imageEntrée audioSortie audio

Benchmarks

MOS (Naturalness)
4.2/5.0

Comparaison côte à côte

ModèleNiveauEntréeSortieContexte
MAI-Thinking-1Reasoning$5.00$20.00262K
MAI-Code-1-FlashLite$0.750$3.00131K
MAI-Image-2.5Flagship$5.00$47.008K
MAI-Image-2.5-FlashMid-tier$1.75$15.008K
MAI-Transcribe-1.5Flagship$0.360$0.00000
MAI-Voice-2Flagship$2.00$10.000
MAI-Voice-2-FlashMid-tier$0.500$2.500