Zurück zur Entwicklerzone

Google Modelle

Entdecken Sie alle 10 Modelle von Google mit detaillierten Preisen, Vor- und Nachteilen sowie Entwicklerempfehlungen.

10
Modelle
$0.0000
Niedrigster Input
1.0M
Max. Kontext
3
Qualitätsstufen

Schnellempfehlungen

Bestes Preis-Leistungs-Verhältnis: DiffusionGemma ($0.0000/1M)
Beste Qualität: Gemini 3.1 Pro

Gemini 3.7 Flash

NEUMid-tier

Coding, instruction following

Offizielle Preise

Wann verwenden: Best pick for high-volume coding assistants, agentic pipelines and tool-calling workloads on a budget.

Upgrade-Highlights

  • GA on August 13, 2026 — three weeks after Gemini 3.6 Flash
  • Priced at half of Gemini 3.6 Flash: $0.75 input / $3.75 output per 1M
  • 1,048,576-token context, 65,536-token max output
Input-Preis
$0.750
per 1M tokens
Output-Preis
$3.75
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 1.0M
Max. Output: 65,536 tokens
Wissensstand: 2026-01
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • Google's most intelligent Flash model (GA Aug 13, 2026)
  • Purpose-built for coding and agents
  • 1M context at $0.75/$3.75 — half the price of Gemini 3.6 Flash

Nachteile

  • Below Pro-tier reasoning on the hardest tasks
  • Very new — ecosystem tooling still catching up

Leistung

Ausgabegeschwindigkeit~120 tok/s
Rate-Limit

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Gemini 3.1 Pro

Flagship

Fortgeschrittenes Denken, Programmierung

Offizielle Preise

Wann verwenden: Bestes Google-Modell für komplexes Denken und professionelle Programmieraufgaben.

Upgrade-Highlights

  • MMLU: 89,2% — deutlich verbessertes Denken im Vergleich zu Gemini 2.5 Pro
  • 1M Kontext mit 65K Ausgabe — gleicher Kontext, bessere Qualität
  • 50% Batch-Rabatt ($1/$6) — günstigster Batch-Flaggschiff verfügbar
  • Kontext-Caching: $0,50/M — 75% Einsparungen bei wiederholten Präfixen
  • Nur kostenpflichtige Vorschau — kein kostenloser Tarif, aber Produktionszuverlässigkeit
Input-Preis
$2.00
per 1M tokens
Output-Preis
$12.00
per 1M tokens
Cached Input
$0.500
per 1M tokens
Batch-Input
$1.00
per 1M tokens
Kontextfenster: 1M
Max. Output: 65,536 tokens
Wissensstand: 2025-06
VisionFunktionsaufrufFeinabstimmungJSON-Modus

Vorteile

  • 1M Kontext mit 65K Ausgabe
  • Deutlich verbessertes Denken im Vergleich zu 3.0
  • 50% Batch-Rabatt verfügbar

Nachteile

  • Kein kostenloser Tarif (nur kostenpflichtige Vorschau)
  • Langkontext-Eingabe 2x über 200K
  • Noch in der Entwicklung

Leistung

Ausgabegeschwindigkeit~55 tok/s
Rate-Limit5,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
89.2%
SWE-bench Verified
68.0%
GPQA
74.5%

Gemini 3.5 Pro

Flagship

Komplexe Codierung, fortgeschrittene Mathematik, tiefgehendes Denken

Offizielle Preise

Wann verwenden: Bestes Google-Modell für komplexe Codierung, fortgeschrittene Mathematik und tiefgehende Denkaufgaben, bei denen Genauigkeit am wichtigsten ist.

Upgrade-Highlights

  • Neuestes Flaggschiff mit verbessertem Reasoning gegenüber 3.1 Pro
  • 1M Kontext mit gestaffelten Preisen: $1.25/$10 (≤200K), $2.50/$15 (>200K)
  • Kostenlose Stufe mit Ratenbegrenzungen verfügbar — einziges Flaggschiff mit kostenlosem Zugang
  • 50% Batch-Rabatt ($0.625/$5) — günstigstes Batch-Flaggschiff
  • Kontext-Caching: $0.315/M — 75% Einsparungen bei wiederholten Präfixen
Input-Preis
$1.25
per 1M tokens
Output-Preis
$10.00
per 1M tokens
Cached Input
$0.315
per 1M tokens
Batch-Input
$0.625
per 1M tokens
Kontextfenster: 1M
Max. Output: 65,536 tokens
Wissensstand: 2026-06
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • 1M Kontext mit gestaffelten Preisen
  • Beste Reasoning-Benchmarks der Klasse
  • Kostenlose Stufe mit Ratenbegrenzungen
  • 50% Batch-Rabatt verfügbar

Nachteile

  • Langer Kontext (>200K) 2x teurer
  • Keine Unterstützung für Feintuning
  • Ausgabe enthält Denk-Token

Leistung

Ausgabegeschwindigkeit~50 tok/s
Rate-Limit5,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
90.5%
SWE-bench Verified
72.0%
GPQA
78.0%

Agenten die dieses Modell verwenden

4

Gemini Omni Flash

Mid-tier

Multimodale Generierung: Text, Bild, Audio und Video

Offizielle Preise

Wann verwenden: Am besten geeignet für multimodale kreative Arbeit, die Text, Bild, Audio und Video in einem einzigen Modell umfasst.

Upgrade-Highlights

  • Erstes Spitzenmodell, das Text, Bild, Audio und Video nativ vereinheitlicht
  • Eingabe: $1.50/M für alle Modalitäten (Text/Bild/Video/Audio)
  • Textausgabe: $9/M — Videoausgabe: $17.50/M (~$0.10/Sek bei 720p)
  • Ermöglicht agentische kreative Workflows und Echtzeit-Videobearbeitung
Input-Preis
$1.50
per 1M tokens
Output-Preis
$9.00
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 1M
Max. Output: 65,536 tokens
Wissensstand: 2026-06
VisionFunktionsaufrufFeinabstimmungJSON-Modus

Vorteile

  • Erstes nativ vereinheitlichtes Text-/Bild-/Audio-/Video-Modell
  • Echtzeit-Videobearbeitung
  • $1.50/M Eingabe für alle Modalitäten
  • Agentische kreative Workflows

Nachteile

  • Videoausgabe mit $17.50/M ist teuer
  • Kein kostenloser Tarif
  • Vorschau — kann sich ändern

Leistung

Ausgabegeschwindigkeit~60 tok/s
Rate-Limit3,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Gemini 3.5 Flash

Mid-tier

Schnelle, intelligente Generierung

Offizielle Preise

Wann verwenden: Beste Balance aus Geschwindigkeit und Intelligenz für Produktions-Apps, die multimodale Fähigkeiten benötigen.

Upgrade-Highlights

  • Spitzenintelligenz zum Mittelklassepreis — entspricht der Qualität von Gemini 2.5 Pro
  • 1M Kontext + 65K Ausgabe für $1.50/$9 — 8x günstiger als das Flaggschiff
  • Kostenlose Stufe mit Ratenbegrenzungen verfügbar — bestes kostenloses Modell von Google
  • Kontext-Caching: $0.375/M — 75% Ersparnis bei zwischengespeicherter Eingabe
  • Multimodal (Text + Vision) mit Blitzgeschwindigkeit — typische Latenz unter 1s
Input-Preis
$1.50
per 1M tokens
Output-Preis
$9.00
per 1M tokens
Cached Input
$0.375
per 1M tokens
Batch-Input
$0.750
per 1M tokens
Kontextfenster: 1M
Max. Output: 65,536 tokens
Wissensstand: 2025-06
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • Spitzenintelligenz zum Mittelklassepreis
  • 1M Kontext + 65K Ausgabe
  • Kostenlose Stufe mit Ratenbegrenzungen

Nachteile

  • Teurer als 3.1 Flash-Lite
  • Ausgabekosten von $9/M sind im großen Maßstab erheblich
  • Kein Feintuning

Leistung

Ausgabegeschwindigkeit~95 tok/s
Rate-Limit10,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
86.5%
HumanEval
85.0%
MATH
73.0%

Gemini 3.1 Flash-Lite

Lite

Aufgaben mit hohem Volumen und niedriger Latenz

Offizielle Preise

Wann verwenden: Bestes Budget-Modell für Klassifikation, Extraktion und leichte Generierung mit hohem Volumen.

Upgrade-Highlights

  • 1M Kontext bei $0,25/M Eingabe — 6x günstiger als Gemini 2.5 Flash
  • 65K maximale Ausgabe — gleich wie Pro-Stufe zum Lite-Preis
  • Kontext-Caching: $0,0625/M — 90% Einsparungen, bester Cache-Wert
  • Batch-API: $0,125/$0,75 — 50% Einsparungen für asynchrone Verarbeitung
  • Kostenlose Stufe mit Ratenbegrenzung — unbegrenztes Prototyping zum Nulltarif
Input-Preis
$0.250
per 1M tokens
Output-Preis
$1.50
per 1M tokens
Cached Input
$0.063
per 1M tokens
Batch-Input
$0.125
per 1M tokens
Kontextfenster: 1M
Max. Output: 65,536 tokens
Wissensstand: 2025-04
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • 1M Kontext bei $0,25/M Eingabe — unglaublicher Wert
  • 65K maximale Ausgabe
  • 90% Einsparungen durch Kontext-Caching

Nachteile

  • Qualität unter 3.5 Flash für komplexe Aufgaben
  • Kein Feintuning
  • Neueres Modell, weniger erprobt

Leistung

Ausgabegeschwindigkeit~130 tok/s
Rate-Limit15,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
79.0%
HumanEval
74.5%

Gemini 2.5 Pro

Flagship

Komplexes Denken, langer Kontext

Offizielle Preise

Wann verwenden: Bestes Preis-Leistungs-Flaggschiff-Modell — 1M Kontext zu geringeren Kosten als GPT-4.1 oder Claude Sonnet.

Upgrade-Highlights

  • Günstigster Flaggschiff-Eingang: $1,25/M — 40% günstiger als GPT-4.1
  • 1M Kontextfenster mit 65K Ausgabe — größte Ausgabe unter den Flaggschiffen
  • Kontext-Caching: $0,315/M — 75% Einsparungen bei wiederholten Präfixen
  • Kostenlose Stufe verfügbar — einziges Flaggschiff-Modell mit kostenlosem Zugang
  • MMLU: 85,4% — wettbewerbsfähig mit GPT-4.1 zum halben Preis
Input-Preis
$1.25
per 1M tokens
Output-Preis
$10.00
per 1M tokens
Cached Input
$0.315
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 1.0M
Max. Output: 65,536 tokens
Wissensstand: 2025-01
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • 1M Kontextfenster
  • Günstigster Flaggschiff-Eingang bei $1,25
  • 65K maximale Ausgabe

Nachteile

  • Keine Batch-API
  • Kein Feintuning
  • Höhere Ausgabekosten

Leistung

Ausgabegeschwindigkeit~50 tok/s
Rate-Limit5,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
85.4%
SWE-bench Verified
63.8%
MATH
72.0%

Agenten die dieses Modell verwenden

2

Gemini 2.5 Flash

Mid-tier

Schnelle, effiziente Generierung

Offizielle Preise

Wann verwenden: Unglaublicher Wert für Produktions-Apps — 1M-Kontext für $0,15/1M Eingabe-Token.

Upgrade-Highlights

  • Gleicher 1M-Kontext wie Pro zu 1/8 des Eingabepreises ($0,15 vs $1,25/M)
  • 65K maximale Ausgabe — identisch mit Pro-Stufe für Generierungskapazität
  • Kontext-Caching: $0,0375/M — 97% Ersparnis für gecachte Präfixe
  • Kostenlose Stufe mit großzügigen Ratenlimits — produktionsbereit zum Nulltarif
  • Sub-Sekunden-Latenz — schnellstes Google-Modell für Echtzeit-Apps
Input-Preis
$0.150
per 1M tokens
Output-Preis
$0.600
per 1M tokens
Cached Input
$0.037
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 1.0M
Max. Output: 65,536 tokens
Wissensstand: 2025-01
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • Gleicher 1M-Kontext wie Pro zu 1/8 des Preises
  • 65K maximale Ausgabe
  • Beste Eingabe-Cache-Ersparnisse

Nachteile

  • Keine Batch-API
  • Qualität unter Pro für schwierige Aufgaben
  • Kein Feintuning

Leistung

Ausgabegeschwindigkeit~100 tok/s
Rate-Limit10,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
83.0%
HumanEval
82.5%
MATH
68.0%

Agenten die dieses Modell verwenden

4

Gemini 2.0 Flash

Lite

Ultra-schnell, niedrige Kosten

Offizielle Preise

Wann verwenden: Beste Budgetoption für Extraktion mit hohem Volumen, Klassifikation und feinabgestimmte Modelle.

Upgrade-Highlights

  • Günstigstes Modell mit 1M Kontext: $0,10/M Eingabe — niedrigster Preis am Markt
  • Einziges Lite-Modell mit Feintuning + Vision — vollständiger Funktionsumfang
  • Kontext-Caching: $0,025/M — 97,5% Einsparung bei wiederholten Präfixen
  • 8K maximale Ausgabe ist niedrig — Upgrade auf 2.5 Flash für 65K Ausgabe
  • Feintuning-Unterstützung — am besten für domänenspezifische Klassifikationsmodelle
Input-Preis
$0.100
per 1M tokens
Output-Preis
$0.400
per 1M tokens
Cached Input
$0.025
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 1.0M
Max. Output: 8,192 tokens
Wissensstand: 2024-08
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • Günstigstes Modell auf dem Markt mit 1M Kontext
  • Einziges Lite-Modell mit Feintuning + Vision
  • Vollständiger Funktionsumfang

Nachteile

  • 8K maximale Ausgabe ist niedrig
  • Älterer Wissensstand
  • Qualität unter 2.5 Flash

Leistung

Ausgabegeschwindigkeit~140 tok/s
Rate-Limit15,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
78.5%
HumanEval
75.0%
MATH
62.0%

DiffusionGemma

Mid-tier

Schnelle lokale Texterzeugung, parallele Dekodierung

Offizielle Preise

Wann verwenden: Wenn Sie schnelle, lokale Texterzeugung auf Consumer-GPUs benötigen und für 4-fache Geschwindigkeit etwas Qualität opfern können.

Upgrade-Highlights

  • 26B Gesamt-MoE, 3,8B aktiv — läuft auf einer einzelnen 24-GB-GPU
  • 4x schnellere Texterzeugung durch diffusionsbasierte parallele Dekodierung
  • Apache 2.0 Open-Source — überall bereitstellen, frei feinabstimmen
  • Bidirektionaler Kontext ermöglicht Selbstkorrektur
  • Kompromiss: niedrigere Benchmark-Ergebnisse im Vergleich zu Standard-Gemma 4
Input-Preis
$0.0000
per 1M tokens
Output-Preis
$0.0000
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 262K
Max. Output: 32,768 tokens
Wissensstand: 2025-06
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • 4x schneller als Standard-Gemma durch parallele Diffusionsdekodierung
  • 26B MoE mit nur 3,8B aktiven Parametern — passt in 24 GB VRAM
  • Open-Source unter Apache 2.0 — vollständige Gewichte verfügbar
  • Bidirektionaler Kontext zur Selbstkorrektur

Nachteile

  • Liegt bei jedem Benchmark hinter Standard-Gemma 4
  • Keine Bild- oder Audio-Unterstützung
  • Kein Funktionsaufruf
  • Experimentell — nicht für produktionskritische Arbeitslasten

Leistung

Ausgabegeschwindigkeit~200 tok/s
Rate-Limit

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
72.0%
HumanEval
68.0%

Nebeneinander-Vergleich

ModellStufeInputOutputKontext
Gemini 3.7 FlashMid-tier$0.750$3.751.0M
Gemini 3.1 ProFlagship$2.00$12.001M
Gemini 3.5 ProFlagship$1.25$10.001M
Gemini Omni FlashMid-tier$1.50$9.001M
Gemini 3.5 FlashMid-tier$1.50$9.001M
Gemini 3.1 Flash-LiteLite$0.250$1.501M
Gemini 2.5 ProFlagship$1.25$10.001.0M
Gemini 2.5 FlashMid-tier$0.150$0.6001.0M
Gemini 2.0 FlashLite$0.100$0.4001.0M
DiffusionGemmaMid-tier$0.0000$0.0000262K