Microsoft Modelle
Entdecken Sie alle 7 Modelle von Microsoft mit detaillierten Preisen, Vor- und Nachteilen sowie Entwicklerempfehlungen.
Schnellempfehlungen
MAI-Thinking-1
ReasoningKomplexes Denken, Mathematik, agentisches Codieren
Wann verwenden: Für komplexes mehrstufiges Denken, mathematische Probleme und agentisches Codieren, bei dem Genauigkeit wichtiger ist als rohe Geschwindigkeit.
Upgrade-Highlights
- ◆~1B Gesamtparameter, 35B aktives MoE — wettbewerbsfähig im mittleren Gewicht
- ◆AIME 2025: 97,0%, AIME 2026: 94,5% — fortgeschrittenes mathematisches Denken
- ◆SWE-bench Pro: wettbewerbsfähig mit Claude Opus 4.6
- ◆Schnellere First-Token-Latenz als o3 für Echtzeit-Denken
- ◆Saubere, rückverfolgbare Unternehmensdaten — keine Destillation
Vorteile
- 35B aktiv / ~1B Gesamtparameter — stark für seine Gewichtsklasse
- AIME 2025: 97,0%, AIME 2026: 94,5% — erstklassiges mathematisches Denken
- Keine Destillation — von Grund auf mit sauberen Daten trainiert
- In blinden menschlichen Bewertungen Sonnet 4.6 vorgezogen
Nachteile
- Noch keine Bildunterstützung
- Neues Modell — begrenzte unabhängige Benchmarks
- Azure-zentrierte Verfügbarkeit
- Höhere Kosten als Modelle ohne Denkfähigkeit
Leistung
Multimodal
Benchmarks
MAI-Code-1-Flash
LiteSchnelles agentisches Codieren, IDE-Integration
Wann verwenden: Am besten geeignet für schnelle Code-Vervollständigung, Inline-Vorschläge und tägliche Codierungsunterstützung in IDE-Umgebungen.
Upgrade-Highlights
- ◆5B aktive Parameter — vergleichbar mit Haiku, aber 60% günstiger
- ◆$0,75/M Eingabe — günstigstes Codierungsmodell auf dem Markt
- ◆60% weniger Tokens pro Aufgabe — inferenzeffizientes Design
- ◆Native GitHub Copilot- und VS Code-Integration
- ◆HumanEval: 92%+ — starke Codierungsgenauigkeit bei dieser Größe
Vorteile
- 60% weniger Tokens pro Aufgabe im Vergleich zu Alternativen
- 5B aktive Parameter — extrem niedrige Latenz
- Tief in GitHub Copilot und VS Code integriert
- Günstiger als Haiku bei $0,75/M Eingabe
Nachteile
- Kleineres Modell — schwächer bei komplexen Multi-Datei-Aufgaben
- Keine Bildunterstützung
- Auf Codierungsaufgaben beschränkt — nicht universell einsetzbar
- 128K Kontext ist kleiner als bei Flaggschiffmodellen
Leistung
Multimodal
Benchmarks
MAI-Image-2.5
FlagshipUnternehmensweite Bildgenerierung und -bearbeitung
Wann verwenden: Für markensichere, richtlinienkonforme Bildgenerierung und -bearbeitung in Unternehmens- und Microsoft 365-Workflows.
Upgrade-Highlights
- ◆Vereinheitlichte Text-zu-Bild + Bildbearbeitung in einem Modell
- ◆Arena ELO: übertrifft Nano Banana Pro
- ◆Überlegene Textdarstellung in generierten Bildern
- ◆Unternehmenskonformitär: private Azure-Bereitstellung
- ◆Flash-Variante für günstigere und schnellere Generierung verfügbar
Vorteile
- Weltklasse Text-zu-Bild und Bildbearbeitung in einem Modell
- Übertrifft den Nano Banana Pro Arena Score
- Unternehmensniveau: private Azure-Bereitstellung verfügbar
- Saubere Textdarstellung in Bildern
Nachteile
- Teure Ausgabe mit $47/M Tokens
- Nicht so künstlerisch wie Midjourney
- Azure-zentrierte Verfügbarkeit
- Keine Funktionsaufrufe
Leistung
Multimodal
Benchmarks
MAI-Image-2.5-Flash
Mid-tierSchnelle, kosteneffiziente Bildgenerierung
Wann verwenden: Für die Bildgenerierung mit hohem Volumen, bei der Geschwindigkeit und Kosten wichtiger sind als absolute Qualität.
Upgrade-Highlights
- ◆$1.75/$15 — 65% günstiger als MAI-Image-2.5
- ◆Optimiert für Hochdurchsatz-Generierung
- ◆Kostenlose Stufe für die Entwicklung verfügbar
- ◆Gleiche Modellfamilie wie MAI-Image-2.5
Vorteile
- Viel günstiger als das Standard-MAI-Image-2.5
- Schnelle Generierung für Workflows mit hohem Volumen
- Gleiche Qualität wie MAI-Image-2.5 für die meisten Prompts
- Kostenlose Stufe verfügbar
Nachteile
- Geringere Qualität bei komplexen Multi-Objekt-Prompts
- Keine Funktionsaufrufe
- Azure-zentriert
- Weniger Details in feinen Texturen
Leistung
Multimodal
Benchmarks
MAI-Transcribe-1.5
FlagshipEnterprise-Spracherkennung, Echtzeit-Transkription
Wann verwenden: Für Enterprise-Meeting-Transkription, Call-Center-Analyse, medizinische Diktate und mehrsprachige Untertitelung.
Upgrade-Highlights
- ◆SOTA-Genauigkeit: übertrifft Whisper Large v3 bei englischer und mehrsprachiger ASR
- ◆5x schneller als konkurrierende Transkriptionsmodelle
- ◆43 Sprachen mit integrierter Domänenvokabular-Unterstützung
- ◆Sprecherdiarisierung: identifiziert, wer was gesagt hat
- ◆$0.36/Stunde — wettbewerbsfähige Preise für Enterprise-STT
Vorteile
- Beste Transkriptionsgenauigkeit der Klasse — SOTA bei ASR-Benchmarks
- 5x schneller als konkurrierende Modelle
- 43 Sprachen mit domänenspezifischer Terminologie
- Sprecherdiarisierung und Echtzeit-Streaming
Nachteile
- Spezialisiertes Modell — nur Transkription
- Preis pro Audiostunde, nicht pro Token
- Azure-zentrierte Verfügbarkeit
- Keine Textgenerierungsfähigkeiten
Leistung
Multimodal
Benchmarks
MAI-Voice-2
FlagshipHochwertige TTS, Sprachklonierung, Konversations-KI
Wann verwenden: Für Sprachbots im Kundenservice, Barrierefreiheitstools, E-Learning-Inhalte und Echtzeit-Konversations-KI.
Upgrade-Highlights
- ◆15 Sprachen mit natürlicher Prosodie und Tonkontrolle
- ◆Sprachklonierung: Anpassung aus kurzen Audioaufnahmen
- ◆Latenz unter 300 ms — geeignet für Echtzeit-Dialoge
- ◆Starke integrierte Schutzmaßnahmen gegen Missbrauch
- ◆Flash-Variante für extrem kostengünstige Bereitstellung verfügbar
Vorteile
- Natürlich klingende Sprache in 15 Sprachen
- Sprachklonierung aus kurzen Audioaufnahmen
- Latenz unter 300 ms für Echtzeit-Konversation
- Enterprise-Compliance und Azure-Integration
Nachteile
- Spezialisiertes Modell — nur Sprachsynthese
- Sprachklonierung erfordert Enterprise-Freigabe
- Weniger flexible Klonierung als ElevenLabs
- Azure-zentrierte Verfügbarkeit
Leistung
Multimodal
Benchmarks
MAI-Voice-2-Flash
Mid-tierSprachsynthese zu extrem niedrigen Kosten
Wann verwenden: Für TTS-Anwendungen mit hohem Volumen, bei denen Kosteneffizienz wichtiger ist als absolute Sprachqualität.
Upgrade-Highlights
- ◆$0.50/$2.50 — 75% günstiger als MAI-Voice-2
- ◆Kostenlose Stufe für Entwicklung und Tests
- ◆Gleiche 15-Sprachabdeckung wie MAI-Voice-2
- ◆Optimiert für hohen Durchsatz und niedrige Latenz
Vorteile
- Hocheffizientes TTS mit 75% geringeren Kosten
- Kostenlose Stufe verfügbar
- Gleiche Sprachabdeckung wie MAI-Voice-2
- Niedrige Latenz für Echtzeitanwendungen
Nachteile
- Etwas geringere Natürlichkeit als MAI-Voice-2
- Keine Sprachklonierung in der Flash-Variante
- Spezialisiertes Modell — nur Sprache
- Neueres Modell — begrenzte unabhängige Bewertungen
Leistung
Multimodal
Benchmarks
Nebeneinander-Vergleich
| Modell | Stufe | Input | Output | Kontext |
|---|---|---|---|---|
| MAI-Thinking-1 | Reasoning | $5.00 | $20.00 | 262K |
| MAI-Code-1-Flash | Lite | $0.750 | $3.00 | 131K |
| MAI-Image-2.5 | Flagship | $5.00 | $47.00 | 8K |
| MAI-Image-2.5-Flash | Mid-tier | $1.75 | $15.00 | 8K |
| MAI-Transcribe-1.5 | Flagship | $0.360 | $0.0000 | 0 |
| MAI-Voice-2 | Flagship | $2.00 | $10.00 | 0 |
| MAI-Voice-2-Flash | Mid-tier | $0.500 | $2.50 | 0 |