OpenAI Modelle
Entdecken Sie alle 16 Modelle von OpenAI mit detaillierten Preisen, Vor- und Nachteilen sowie Entwicklerempfehlungen.
Schnellempfehlungen
GPT-5.6 Sol
NEUFlagshipAgentic coding, complex workloads
Wann verwenden: Best for frontier agentic coding, deep research and mission-critical workloads where accuracy matters most.
Upgrade-Highlights
- ◆GPT-5.6 flagship tier — released July 9, 2026
- ◆Price held at $5/$30 while Terra and Luna were cut on July 30
- ◆1.05M context, 128K max output, cache reads at $0.50/M (90% off)
Vorteile
- Flagship tier of the GPT-5.6 family (launched Jul 9, 2026)
- 1.05M shared context window with 128K max output
- Fast mode available at 2x base price
- Explicit cache breakpoints with 30-min minimum cache life
Nachteile
- Output still costs $30/M tokens
- No fine-tuning support yet
Leistung
Multimodal
GPT-5.6 Terra
NEUMid-tierBalanced performance & cost
Wann verwenden: The default choice for production apps, agents and high-value everyday workloads.
Upgrade-Highlights
- ◆Price cut 20% on July 30, 2026: $2.50 → $2 input, $15 → $12 output
- ◆Cache reads at $0.20/M (90% off input)
- ◆1.05M context, 128K max output — same window as Sol
Vorteile
- Everyday default tier of GPT-5.6
- 20% price cut on Jul 30, 2026 ($2.50/$15 → $2/$12)
- Same 1.05M context as Sol at less than half the price
Nachteile
- Below Sol-level accuracy on the hardest tasks
- No Fast mode
Leistung
Multimodal
GPT-5.6 Luna
NEULiteHigh-volume, low-latency tasks
Wann verwenden: Ideal for chatbots, classification, extraction, batch jobs and any high-volume latency-sensitive workload.
Upgrade-Highlights
- ◆Price slashed 80% on July 30, 2026: $1 → $0.20 input, $6 → $1.20 output
- ◆Cache reads at $0.02/M — among the cheapest frontier-family caches
- ◆~1/25 of Sol list price for high-volume work
Vorteile
- Fastest and most affordable GPT-5.6 tier
- 80% price cut on Jul 30, 2026 ($1/$6 → $0.20/$1.20)
- Full 1.05M context at budget price
Nachteile
- Lowest capability tier of the family
- Not suited for deep reasoning tasks
Leistung
Multimodal
GPT-5.5
FlagshipAgentisches Codieren, komplexe Arbeitslasten
Wann verwenden: Am besten geeignet für komplexe Codierungsagenten, Computernutzung und professionelle Arbeitslasten, bei denen Genauigkeit am wichtigsten ist.
Upgrade-Highlights
- ◆SWE-bench Verifiziert: 82,7% (+6,5pp vs. GPT-5.4's 76,2%)
- ◆Terminal-Bench: 82,7% — neuer SOTA für agentisches Codieren
- ◆1M-Kontextfenster beibehalten, 33% weniger Tokens als GPT-5.4 bei gleicher Latenz
- ◆GeneBench wissenschaftliches Denken: 28,5% (+3,2pp über GPT-5.4)
- ◆Preis: $5/$30 — 2x GPT-5.4, aber zwischengespeicherte Eingabe 90% günstiger bei $0,50/M
Vorteile
- Modernstes agentisches Codieren (82,7% Terminal-Bench)
- 1M Token-Kontextfenster
- Entspricht GPT-5.4-Latenz mit weniger Tokens
- Starke wissenschaftliche Forschungskapazität
Nachteile
- 2x teurer als GPT-5.4
- Noch kein Fine-Tuning-Support
- Ausgabekosten $30/M Tokens
Leistung
Multimodal
Benchmarks
Agenten die dieses Modell verwenden
7GPT-5.5 Pro
ReasoningPräzise Genauigkeit, parallele Berechnung
Wann verwenden: Verwenden Sie es, wenn Sie maximale Genauigkeit für juristische, medizinische oder wissenschaftliche Analysen benötigen und die Kosten zweitrangig sind.
Upgrade-Highlights
- ◆Parallele Testzeit-Berechnung: führt mehrere Denkpfade aus, wählt den besten aus
- ◆GeneBench (wissenschaftliches Denken): 33,2 % — der höchste jemals aufgezeichnete Wert
- ◆Dedizierte GPU-Zuweisung für Pro/Business/Enterprise-Abonnenten
- ◆Gleicher 1M-Kontext + 128K-Ausgabe wie GPT-5.5 Basis, aber tieferes Denken
- ◆6-facher Preisaufschlag ($30/$180) — nur für kritische Analysen gerechtfertigt
Vorteile
- Höchste Genauigkeit durch parallele Testzeit-Berechnung
- 33,2 % bei GeneBench (wissenschaftliches Denken)
- Dedizierte GPU-Zuweisung für Pro-Abonnenten
Nachteile
- 6x teurer als GPT-5.5 Basis
- Kein Batch-API-Support
- Nur für Pro/Business/Enterprise-Stufen
Leistung
Multimodal
Benchmarks
GPT-5.5 Turbo
Mid-tierHochvolumige Apps, Chatbots, schnelle Inferenz
Wann verwenden: Am besten für hochvolumige Produktions-Apps, die GPT-5.5-Qualität zu geringeren Kosten benötigen — Chatbots, Zusammenfassungen, Klassifikation.
Upgrade-Highlights
- ◆GPT-5.5-Klasse-Qualität zu ~33% geringeren Ausgabekosten ($20 vs $30/M)
- ◆200K-Kontextfenster — ausreichend für die meisten Produktionsanwendungsfälle
- ◆Schnelle Inferenz: 1,5x schneller als GPT-5.5 für Echtzeitanwendungen
- ◆Gleiche maximale Ausgabe von 128K wie GPT-5.5 Basis
- ◆Kostenlose Stufe verfügbar — bester Wert für hochvolumige Bereitstellungen
Vorteile
- GPT-5.5-Klasse-Intelligenz zu geringeren Kosten
- 200K-Kontextfenster
- 33% günstigere Ausgabe als GPT-5.5
- Schnelle Inferenz für Echtzeit-Apps
Nachteile
- Kleinerer Kontext im Vergleich zu GPT-5.5 (200K vs 1M)
- Kein Fine-Tuning-Support
- Etwas geringere Argumentationsgenauigkeit
Leistung
Multimodal
Benchmarks
GPT-5.4
FlagshipCodierung, Computernutzung, Wissensarbeit
Wann verwenden: Hervorragender Allrounder für Codierungsassistenten, Desktop-Automatisierung und unternehmerische Wissensarbeit.
Upgrade-Highlights
- ◆OSWorld: 75% — erste KI, die die Desktop-Automatisierung auf menschlichem Niveau übertrifft
- ◆33% weniger faktische Fehler vs GPT-5.2 (Halluzinationsreduktion)
- ◆Tool Search: entdeckt dynamisch Werkzeuge, reduziert Agenten-Token-Nutzung um ~40%
- ◆Kontext: 128K → 1M Tokens (8-fache Steigerung gegenüber GPT-4o)
- ◆Maximale Ausgabe: 16K → 128K Tokens (8-fache Steigerung), Preis $2.50/$15
Vorteile
- Erste KI, die die menschliche Desktop-Leistung übertrifft (75% OSWorld)
- Vereinheitlichte Codierung + Computernutzung + Wissensarbeit
- 33% weniger faktische Fehler als GPT-5.2
- Tool Search reduziert Token-Nutzung für Agenten
Nachteile
- Teurer als GPT-4.1
- Noch kein Feintuning
- Eingabepreis verdoppelt sich über 272K Kontext
Leistung
Multimodal
Benchmarks
GPT-5.4 Mini
Mid-tierKosteneffizientes Codieren und Entwicklungsaufgaben
Wann verwenden: Bester Wert für hochvolumige Codierungsaufgaben, Chatbots und leichtere Entwicklungsworkloads.
Upgrade-Highlights
- ◆SWE-bench Pro: 54,38% — nur 3,3 pp unter den 57,7% des GPT-5.4 Standard
- ◆6x günstiger als GPT-5.4 Standard ($0,75 vs $5/M Eingabe)
- ◆400K Kontextfenster — ausreichend für die meisten Codierungsaufgaben
- ◆Gleiche maximale Ausgabe von 128K wie das Flaggschiff, 90% Eingabeeinsparungen durch Cache
- ◆12 Tage nach Standard veröffentlicht — schnellste Mini-Variante aller Zeiten
Vorteile
- 54,38% SWE-bench Pro (nahe an den 57,7% des Standard)
- 6x günstiger als GPT-5.4 Standard
- 400K Kontextfenster
- Kostenloser Zugang verfügbar
Nachteile
- Geringere Denkqualität als Standard
- Kontextfenster kleiner als volle 1M
- 12 Tage nach Standard veröffentlicht
Leistung
Multimodal
Benchmarks
GPT-5.4 Nano
LiteEdge, eingebettet, mobil
Wann verwenden: Ideal für On-Device-Assistenten, mobile Apps und Szenarien, in denen Netzwerklatenz eine Rolle spielt.
Upgrade-Highlights
- ◆Entwickelt für Edge/Mobile/IoT — optimiert für On-Device-Inferenz
- ◆128K maximale Ausgabe bei 272K Kontext — höchstes Ausgabe/Kontext-Verhältnis
- ◆Vision + Funktionsaufruf für $0,20/M Eingabe — zuvor nur für Flaggschiff-Modelle
- ◆Latenzoptimiert für Echtzeit-Mobilinteraktionen
- ◆Kontext 272K vs 1M für Standard — Kompromiss zwischen Geschwindigkeit und Kosten
Vorteile
- Extrem niedrige Kosten für Edge-Bereitstellungen
- Entwickelt für mobile und IoT-Geräte
- 128K maximale Ausgabe trotz kleiner Größe
Nachteile
- Begrenzte verfügbare Benchmarks
- Kleineres Kontextfenster
- Qualitätslücke bei komplexen Aufgaben
Leistung
Multimodal
Benchmarks
GPT-4o
FlagshipAllzweck, multimodal
Wann verwenden: Beste Standardwahl für die meisten Apps, die hochwertige multimodale Ausgabe benötigen.
Upgrade-Highlights
- ◆Erstes nativ multimodales Modell: Text + Bild + Audio in einem Modell
- ◆2x schneller als GPT-4 Turbo bei 50% geringeren Kosten ($2,50 vs. $5/M Eingabe)
- ◆Native Audioverarbeitung — keine separate Whisper-Pipeline erforderlich
- ◆Feinabstimmungsunterstützung für Domänenanpassung (exklusiv für Flaggschiff)
- ◆128K Kontext — durch 1M von GPT-4.1 für Langdokumentaufgaben ersetzt
Vorteile
- Multimodal (Text + Bild + Audio)
- Hervorragende Allzweckqualität
- Starke Funktionsaufrufe & JSON-Modus
Nachteile
- Höhere Kosten als Mini-/Nano-Varianten
- 128K Kontext vs. 1M+ bei neueren 4.1-Modellen
Leistung
Multimodal
Benchmarks
Agenten die dieses Modell verwenden
3GPT-4o Mini
LiteSchnelle, kosteneffiziente Aufgaben
Wann verwenden: Ideal für hochvolumige, kostenempfindliche Arbeitslasten wie Chatbots und Zusammenfassungen.
Upgrade-Highlights
- ◆Ersetzt GPT-3.5 Turbo: 46 % günstiger, deutlich bessere Qualität
- ◆Gleicher 128K-Kontext wie GPT-4o zu 1/17 des Preises
- ◆Erzielte 82 % im MMLU — nähert sich GPT-4-Niveau bei Wissensaufgaben
- ◆Vision + Funktionsaufrufe für 0,15 $/M — zuvor nur für Flaggschiffe verfügbar
- ◆Feinabstimmung verfügbar — bestes Kosten-/Qualitätsverhältnis für abgestimmte Modelle
Vorteile
- Extrem günstig
- Gleicher 128K-Kontext wie GPT-4o
- Unterstützt Vision + Funktionsaufrufe
Nachteile
- Geringere Denkqualität als das Flaggschiff
- Nicht ideal für komplexe mehrstufige Aufgaben
Leistung
Multimodal
Benchmarks
GPT-4.1
FlagshipCodierung, Befolgung von Anweisungen
Wann verwenden: Beste Wahl für Codierungsassistenten und die Analyse langer Dokumente.
Upgrade-Highlights
- ◆Kontext: 128K → 1M Token (8-facher Sprung gegenüber GPT-4o)
- ◆SWE-bench Verifiziert: 54,6% — beste Codierungsbewertung beim Start
- ◆Maximale Ausgabe: 32K Token (2x GPT-4os 16K)
- ◆Befolgung von Anweisungen: 40% besser bei IFEval im Vergleich zu GPT-4o
- ◆Günstiger als GPT-4o ($2 vs $2,50/M Eingabe) mit mehr Fähigkeiten
Vorteile
- 1M Token-Kontextfenster
- Beste Codierungsfähigkeit seiner Klasse
- Günstiger als GPT-4o mit besserem Kontext
Nachteile
- Langsamer als mini/nano für einfache Aufgaben
- Neueres Modell, weniger erprobt
Leistung
Multimodal
Benchmarks
Agenten die dieses Modell verwenden
82GPT-4.1 Mini
Mid-tierAusgewogene Leistung & Kosten
Wann verwenden: Idealer Punkt für Produktions-Apps, die langen Kontext ohne Flaggschiff-Kosten benötigen.
Upgrade-Highlights
- ◆1M Kontext bei $0,40/M Eingabe — 5x günstiger als GPT-4.1 Flaggschiff
- ◆Gleicher 1M Kontext + 32K Ausgabe wie Flaggschiff für Produktionseinsatz
- ◆Volle multimodale Unterstützung (Vision, Funktionsaufruf, Feinabstimmung)
- ◆SWE-bench: 42,8% — starke Codierung zu Mittelklassepreisen
- ◆Ersetzt GPT-4o Mini für Produktions-Workloads mit langem Kontext
Vorteile
- 1M Kontext zum Mittelklassepreis
- Starke Codierung für den Preis
- Volle multimodale Unterstützung
Nachteile
- Qualitätslücke im Vergleich zum Flaggschiff bei komplexem Denken
- Immer noch teurer als nano
Leistung
Multimodal
Benchmarks
GPT-4.1 Nano
LiteUltra-niedrige Latenz, Edge-Geräte
Wann verwenden: Ideal für Echtzeit-Klassifikation, Extraktion und Hochdurchsatz-Pipelines.
Upgrade-Highlights
- ◆Günstigstes Modell mit 1M Kontext: $0,10/M Eingabe (GPT-3.5 Turbo war $0,50)
- ◆Vollständiger Funktionsumfang auf Lite-Ebene: Vision + Funktionsaufruf + Feintuning
- ◆Kontext: 128K → 1M (8-fache Steigerung gegenüber GPT-4o Minis 128K)
- ◆Schnellste Antwortzeiten im OpenAI-Lineup — typische Latenz unter 200ms
- ◆Zwischengespeicherte Eingabe für $0,025/M — 97,5% Einsparung bei wiederholten Präfixen
Vorteile
- Günstigstes OpenAI-Modell mit 1M Kontext
- Schnellste Antwortzeiten
- Vollständiger Funktionsumfang (Vision, FC, Feintuning)
Nachteile
- Spürbarer Qualitätsabfall bei komplexen Aufgaben
- Nicht geeignet für tiefgehendes Denken
Leistung
Multimodal
Benchmarks
o3
ReasoningKomplexes Denken, Mathematik, Naturwissenschaften
Wann verwenden: Verwenden Sie es für Probleme, die schrittweises Denken, mathematische Beweise und wissenschaftliche Analysen erfordern.
Upgrade-Highlights
- ◆ARC-AGI: 87,5% — nahezu menschlich bei neuartigen abstrakten Denkaufgaben
- ◆Maximale Ausgabe: 100K Token (4x o1s 25K) für tiefe Gedankenketten
- ◆Vision + Funktionsaufruf — neue Fähigkeiten im Vergleich zu o1s reiner Textverarbeitung
- ◆Mathematik-Olympiade: Goldmedaillen-Niveau bei AIME 2024 (93,3%)
- ◆Preis: $2/$8 — 1/3 der Kosten von o1 Pro bei $200/M
Vorteile
- Modernste Denkfähigkeit
- 100K maximale Ausgabe für lange Gedankenketten
- Hervorragend in Mathematik und Naturwissenschaften
Nachteile
- Langsamer aufgrund der Denkzeit
- Keine Unterstützung für Feintuning
- Höhere Kosten für Denk-Token
Leistung
Multimodal
Benchmarks
Agenten die dieses Modell verwenden
1o4-mini
ReasoningSchlussfolgerung zu geringeren Kosten
Wann verwenden: Bester Wert für Reasoning-Workloads — ideal für die Produktion, wo o3 übertrieben ist.
Upgrade-Highlights
- ◆55% günstiger als o3 ($1,10 vs $2/M Eingabe) für Reasoning-Aufgaben
- ◆Gleiche 100K maximale Ausgabe wie o3 — kein Kompromiss bei der Reasoning-Tiefe
- ◆Schnellere Inferenz als o3 mit optimiertem Denkbudget
- ◆Vision + Funktionsaufruf auf Reasoning-Ebene — zuvor nur o3
- ◆Zwischengespeicherte Eingabe: $0,275/M — 75% Ersparnis bei wiederholten Prompts
Vorteile
- 55% günstiger als o3 für Reasoning
- Gleiche 100K maximale Ausgabe
- Schneller als o3
Nachteile
- Weniger leistungsfähig als o3 bei schwierigsten Problemen
- Kein Feintuning
- Reasoning-Token verursachen versteckte Kosten
Leistung
Multimodal
Benchmarks
Agenten die dieses Modell verwenden
1Nebeneinander-Vergleich
| Modell | Stufe | Input | Output | Kontext |
|---|---|---|---|---|
| GPT-5.6 Sol | Flagship | $5.00 | $30.00 | 1.1M |
| GPT-5.6 Terra | Mid-tier | $2.00 | $12.00 | 1.1M |
| GPT-5.6 Luna | Lite | $0.200 | $1.20 | 1.1M |
| GPT-5.5 | Flagship | $5.00 | $30.00 | 1M |
| GPT-5.5 Pro | Reasoning | $30.00 | $180.00 | 1M |
| GPT-5.5 Turbo | Mid-tier | $5.00 | $20.00 | 200K |
| GPT-5.4 | Flagship | $2.50 | $15.00 | 1M |
| GPT-5.4 Mini | Mid-tier | $0.750 | $4.50 | 400K |
| GPT-5.4 Nano | Lite | $0.200 | $1.25 | 272K |
| GPT-4o | Flagship | $2.50 | $10.00 | 128K |
| GPT-4o Mini | Lite | $0.150 | $0.600 | 128K |
| GPT-4.1 | Flagship | $2.00 | $8.00 | 1.0M |
| GPT-4.1 Mini | Mid-tier | $0.400 | $1.60 | 1.0M |
| GPT-4.1 Nano | Lite | $0.100 | $0.400 | 1.0M |
| o3 | Reasoning | $2.00 | $8.00 | 200K |
| o4-mini | Reasoning | $1.10 | $4.40 | 200K |