Zurück zur Entwicklerzone

Microsoft Modelle

Entdecken Sie alle 7 Modelle von Microsoft mit detaillierten Preisen, Vor- und Nachteilen sowie Entwicklerempfehlungen.

7
Modelle
$0.360
Niedrigster Input
262K
Max. Kontext
4
Qualitätsstufen

Schnellempfehlungen

Bestes Preis-Leistungs-Verhältnis: MAI-Transcribe-1.5 ($0.360/1M)
Beste Qualität: MAI-Image-2.5
Am besten für logisches Denken: MAI-Thinking-1

MAI-Thinking-1

Reasoning

Komplexes Denken, Mathematik, agentisches Codieren

Offizielle Preise

Wann verwenden: Für komplexes mehrstufiges Denken, mathematische Probleme und agentisches Codieren, bei dem Genauigkeit wichtiger ist als rohe Geschwindigkeit.

Upgrade-Highlights

  • ~1B Gesamtparameter, 35B aktives MoE — wettbewerbsfähig im mittleren Gewicht
  • AIME 2025: 97,0%, AIME 2026: 94,5% — fortgeschrittenes mathematisches Denken
  • SWE-bench Pro: wettbewerbsfähig mit Claude Opus 4.6
  • Schnellere First-Token-Latenz als o3 für Echtzeit-Denken
  • Saubere, rückverfolgbare Unternehmensdaten — keine Destillation
Input-Preis
$5.00
per 1M tokens
Output-Preis
$20.00
per 1M tokens
Cached Input
$1.00
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 262K
Max. Output: 32,000 tokens
Wissensstand: 2026-03
VisionFunktionsaufrufFeinabstimmungJSON-Modus

Vorteile

  • 35B aktiv / ~1B Gesamtparameter — stark für seine Gewichtsklasse
  • AIME 2025: 97,0%, AIME 2026: 94,5% — erstklassiges mathematisches Denken
  • Keine Destillation — von Grund auf mit sauberen Daten trainiert
  • In blinden menschlichen Bewertungen Sonnet 4.6 vorgezogen

Nachteile

  • Noch keine Bildunterstützung
  • Neues Modell — begrenzte unabhängige Benchmarks
  • Azure-zentrierte Verfügbarkeit
  • Höhere Kosten als Modelle ohne Denkfähigkeit

Leistung

Ausgabegeschwindigkeit~55 tok/s
Rate-Limit3,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

AIME 2025
97.0%
AIME 2026
94.5%
GPQA Diamond
82.0%

MAI-Code-1-Flash

Lite

Schnelles agentisches Codieren, IDE-Integration

Offizielle Preise

Wann verwenden: Am besten geeignet für schnelle Code-Vervollständigung, Inline-Vorschläge und tägliche Codierungsunterstützung in IDE-Umgebungen.

Upgrade-Highlights

  • 5B aktive Parameter — vergleichbar mit Haiku, aber 60% günstiger
  • $0,75/M Eingabe — günstigstes Codierungsmodell auf dem Markt
  • 60% weniger Tokens pro Aufgabe — inferenzeffizientes Design
  • Native GitHub Copilot- und VS Code-Integration
  • HumanEval: 92%+ — starke Codierungsgenauigkeit bei dieser Größe
Input-Preis
$0.750
per 1M tokens
Output-Preis
$3.00
per 1M tokens
Cached Input
$0.150
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 131K
Max. Output: 16,384 tokens
Wissensstand: 2026-03
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • 60% weniger Tokens pro Aufgabe im Vergleich zu Alternativen
  • 5B aktive Parameter — extrem niedrige Latenz
  • Tief in GitHub Copilot und VS Code integriert
  • Günstiger als Haiku bei $0,75/M Eingabe

Nachteile

  • Kleineres Modell — schwächer bei komplexen Multi-Datei-Aufgaben
  • Keine Bildunterstützung
  • Auf Codierungsaufgaben beschränkt — nicht universell einsetzbar
  • 128K Kontext ist kleiner als bei Flaggschiffmodellen

Leistung

Ausgabegeschwindigkeit~150 tok/s
Rate-Limit10,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

HumanEval
92.0%
SWE-bench Lite
55.0%

MAI-Image-2.5

Flagship

Unternehmensweite Bildgenerierung und -bearbeitung

Offizielle Preise

Wann verwenden: Für markensichere, richtlinienkonforme Bildgenerierung und -bearbeitung in Unternehmens- und Microsoft 365-Workflows.

Upgrade-Highlights

  • Vereinheitlichte Text-zu-Bild + Bildbearbeitung in einem Modell
  • Arena ELO: übertrifft Nano Banana Pro
  • Überlegene Textdarstellung in generierten Bildern
  • Unternehmenskonformitär: private Azure-Bereitstellung
  • Flash-Variante für günstigere und schnellere Generierung verfügbar
Input-Preis
$5.00
per 1M tokens
Output-Preis
$47.00
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 8K
Max. Output: 0 tokens
Wissensstand: 2026-03
VisionFunktionsaufrufFeinabstimmungJSON-Modus

Vorteile

  • Weltklasse Text-zu-Bild und Bildbearbeitung in einem Modell
  • Übertrifft den Nano Banana Pro Arena Score
  • Unternehmensniveau: private Azure-Bereitstellung verfügbar
  • Saubere Textdarstellung in Bildern

Nachteile

  • Teure Ausgabe mit $47/M Tokens
  • Nicht so künstlerisch wie Midjourney
  • Azure-zentrierte Verfügbarkeit
  • Keine Funktionsaufrufe

Leistung

Ausgabegeschwindigkeit~20 tok/s
Rate-Limit1,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

GenEval
88.0%

MAI-Image-2.5-Flash

Mid-tier

Schnelle, kosteneffiziente Bildgenerierung

Offizielle Preise

Wann verwenden: Für die Bildgenerierung mit hohem Volumen, bei der Geschwindigkeit und Kosten wichtiger sind als absolute Qualität.

Upgrade-Highlights

  • $1.75/$15 — 65% günstiger als MAI-Image-2.5
  • Optimiert für Hochdurchsatz-Generierung
  • Kostenlose Stufe für die Entwicklung verfügbar
  • Gleiche Modellfamilie wie MAI-Image-2.5
Input-Preis
$1.75
per 1M tokens
Output-Preis
$15.00
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 8K
Max. Output: 0 tokens
Wissensstand: 2026-03
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • Viel günstiger als das Standard-MAI-Image-2.5
  • Schnelle Generierung für Workflows mit hohem Volumen
  • Gleiche Qualität wie MAI-Image-2.5 für die meisten Prompts
  • Kostenlose Stufe verfügbar

Nachteile

  • Geringere Qualität bei komplexen Multi-Objekt-Prompts
  • Keine Funktionsaufrufe
  • Azure-zentriert
  • Weniger Details in feinen Texturen

Leistung

Ausgabegeschwindigkeit~40 tok/s
Rate-Limit5,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

GenEval
82.0%

MAI-Transcribe-1.5

Flagship

Enterprise-Spracherkennung, Echtzeit-Transkription

Offizielle Preise

Wann verwenden: Für Enterprise-Meeting-Transkription, Call-Center-Analyse, medizinische Diktate und mehrsprachige Untertitelung.

Upgrade-Highlights

  • SOTA-Genauigkeit: übertrifft Whisper Large v3 bei englischer und mehrsprachiger ASR
  • 5x schneller als konkurrierende Transkriptionsmodelle
  • 43 Sprachen mit integrierter Domänenvokabular-Unterstützung
  • Sprecherdiarisierung: identifiziert, wer was gesagt hat
  • $0.36/Stunde — wettbewerbsfähige Preise für Enterprise-STT
Input-Preis
$0.360
per 1M tokens
Output-Preis
$0.0000
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 0
Max. Output: 0 tokens
Wissensstand: 2026-03
VisionFunktionsaufrufFeinabstimmungJSON-Modus

Vorteile

  • Beste Transkriptionsgenauigkeit der Klasse — SOTA bei ASR-Benchmarks
  • 5x schneller als konkurrierende Modelle
  • 43 Sprachen mit domänenspezifischer Terminologie
  • Sprecherdiarisierung und Echtzeit-Streaming

Nachteile

  • Spezialisiertes Modell — nur Transkription
  • Preis pro Audiostunde, nicht pro Token
  • Azure-zentrierte Verfügbarkeit
  • Keine Textgenerierungsfähigkeiten

Leistung

Ausgabegeschwindigkeit
Rate-Limit

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

WER (LibriSpeech)
1.8%
WER (Common Voice)
5.2%

MAI-Voice-2

Flagship

Hochwertige TTS, Sprachklonierung, Konversations-KI

Offizielle Preise

Wann verwenden: Für Sprachbots im Kundenservice, Barrierefreiheitstools, E-Learning-Inhalte und Echtzeit-Konversations-KI.

Upgrade-Highlights

  • 15 Sprachen mit natürlicher Prosodie und Tonkontrolle
  • Sprachklonierung: Anpassung aus kurzen Audioaufnahmen
  • Latenz unter 300 ms — geeignet für Echtzeit-Dialoge
  • Starke integrierte Schutzmaßnahmen gegen Missbrauch
  • Flash-Variante für extrem kostengünstige Bereitstellung verfügbar
Input-Preis
$2.00
per 1M tokens
Output-Preis
$10.00
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 0
Max. Output: 0 tokens
Wissensstand: 2026-03
VisionFunktionsaufrufFeinabstimmungJSON-Modus

Vorteile

  • Natürlich klingende Sprache in 15 Sprachen
  • Sprachklonierung aus kurzen Audioaufnahmen
  • Latenz unter 300 ms für Echtzeit-Konversation
  • Enterprise-Compliance und Azure-Integration

Nachteile

  • Spezialisiertes Modell — nur Sprachsynthese
  • Sprachklonierung erfordert Enterprise-Freigabe
  • Weniger flexible Klonierung als ElevenLabs
  • Azure-zentrierte Verfügbarkeit

Leistung

Ausgabegeschwindigkeit
Rate-Limit

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MOS (Naturalness)
4.5/5.0

MAI-Voice-2-Flash

Mid-tier

Sprachsynthese zu extrem niedrigen Kosten

Offizielle Preise

Wann verwenden: Für TTS-Anwendungen mit hohem Volumen, bei denen Kosteneffizienz wichtiger ist als absolute Sprachqualität.

Upgrade-Highlights

  • $0.50/$2.50 — 75% günstiger als MAI-Voice-2
  • Kostenlose Stufe für Entwicklung und Tests
  • Gleiche 15-Sprachabdeckung wie MAI-Voice-2
  • Optimiert für hohen Durchsatz und niedrige Latenz
Input-Preis
$0.500
per 1M tokens
Output-Preis
$2.50
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 0
Max. Output: 0 tokens
Wissensstand: 2026-03
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • Hocheffizientes TTS mit 75% geringeren Kosten
  • Kostenlose Stufe verfügbar
  • Gleiche Sprachabdeckung wie MAI-Voice-2
  • Niedrige Latenz für Echtzeitanwendungen

Nachteile

  • Etwas geringere Natürlichkeit als MAI-Voice-2
  • Keine Sprachklonierung in der Flash-Variante
  • Spezialisiertes Modell — nur Sprache
  • Neueres Modell — begrenzte unabhängige Bewertungen

Leistung

Ausgabegeschwindigkeit
Rate-Limit

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MOS (Naturalness)
4.2/5.0

Nebeneinander-Vergleich

ModellStufeInputOutputKontext
MAI-Thinking-1Reasoning$5.00$20.00262K
MAI-Code-1-FlashLite$0.750$3.00131K
MAI-Image-2.5Flagship$5.00$47.008K
MAI-Image-2.5-FlashMid-tier$1.75$15.008K
MAI-Transcribe-1.5Flagship$0.360$0.00000
MAI-Voice-2Flagship$2.00$10.000
MAI-Voice-2-FlashMid-tier$0.500$2.500