Google Modèles
Explorez les 10 modèles de Google avec des prix détaillés, avantages et inconvénients, et recommandations pour développeurs.
Recommandations rapides
Gemini 3.7 Flash
NOUVEAUMid-tierCoding, instruction following
Quand l'utiliser: Best pick for high-volume coding assistants, agentic pipelines and tool-calling workloads on a budget.
Points clés de la mise à niveau
- ◆GA on August 13, 2026 — three weeks after Gemini 3.6 Flash
- ◆Priced at half of Gemini 3.6 Flash: $0.75 input / $3.75 output per 1M
- ◆1,048,576-token context, 65,536-token max output
Avantages
- Google's most intelligent Flash model (GA Aug 13, 2026)
- Purpose-built for coding and agents
- 1M context at $0.75/$3.75 — half the price of Gemini 3.6 Flash
Inconvénients
- Below Pro-tier reasoning on the hardest tasks
- Very new — ecosystem tooling still catching up
Performance
Multimodal
Gemini 3.1 Pro
FlagshipRaisonnement avancé, codage
Quand l'utiliser: Meilleur modèle Google pour le raisonnement complexe et les tâches de codage professionnelles.
Points clés de la mise à niveau
- ◆MMLU : 89,2 % — raisonnement nettement amélioré par rapport à Gemini 2.5 Pro
- ◆Contexte de 1M avec sortie de 65K — même contexte, meilleure qualité
- ◆Remise de 50% sur les lots (1 $/6 $) — le lot phare le moins cher disponible
- ◆Mise en cache du contexte : 0,50 $/M — 75 % d'économies pour les préfixes répétés
- ◆Aperçu payant uniquement — pas de niveau gratuit, mais fiabilité de qualité production
Avantages
- Contexte de 1M avec sortie de 65K
- Raisonnement nettement amélioré par rapport à la version 3.0
- Remise de 50% disponible pour les lots
Inconvénients
- Pas de niveau gratuit (aperçu payant uniquement)
- Entrée de long contexte 2x au-dessus de 200K
- Encore en maturation
Performance
Multimodal
Benchmarks
Gemini 3.5 Pro
FlagshipCodage complexe, mathématiques avancées, raisonnement profond
Quand l'utiliser: Meilleur modèle Google pour le codage complexe, les mathématiques avancées et les tâches de raisonnement profond où la précision est primordiale.
Points clés de la mise à niveau
- ◆Dernier flagship avec raisonnement amélioré par rapport à 3.1 Pro
- ◆Contexte de 1M avec tarification par paliers : 1,25$/10$ (≤200K), 2,50$/15$ (>200K)
- ◆Niveau gratuit disponible avec limites de débit — seul flagship avec accès gratuit
- ◆Remise de 50% sur les lots (0,625$/5$) — flagship le moins cher en lots
- ◆Mise en cache du contexte : 0,315$/M — 75% d'économies pour les préfixes répétés
Avantages
- Contexte de 1M avec tarification par paliers
- Meilleurs benchmarks de raisonnement de sa catégorie
- Niveau gratuit avec limites de débit
- Remise de 50% sur les lots disponible
Inconvénients
- Contexte long (>200K) 2x plus cher
- Pas de support de fine-tuning
- La sortie inclut des jetons de réflexion
Performance
Multimodal
Benchmarks
Agents utilisant ce modèle
4Gemini Omni Flash
Mid-tierGénération multimodale : texte, image, audio et vidéo
Quand l'utiliser: Idéal pour le travail créatif multimodal couvrant texte, image, audio et vidéo dans un seul modèle.
Points clés de la mise à niveau
- ◆Premier modèle haut de gamme à unifier nativement texte, image, audio et vidéo
- ◆Entrée : 1,50 $/M pour toutes les modalités (texte/image/vidéo/audio)
- ◆Sortie texte : 9 $/M — Sortie vidéo : 17,50 $/M (~0,10 $/sec en 720p)
- ◆Permet des flux de travail créatifs agentiques et l'édition vidéo en temps réel
Avantages
- Premier modèle nativement unifié texte/image/audio/vidéo
- Manipulation vidéo en temps réel
- 1,50 $/M d'entrée pour toutes les modalités
- Flux de travail créatifs agentiques
Inconvénients
- Sortie vidéo à 17,50 $/M est chère
- Pas de niveau gratuit
- Aperçu — peut changer
Performance
Multimodal
Gemini 3.5 Flash
Mid-tierGénération rapide et intelligente
Quand l'utiliser: Meilleur équilibre entre vitesse et intelligence pour les applications de production nécessitant une capacité multimodale.
Points clés de la mise à niveau
- ◆Intelligence de pointe à prix intermédiaire — correspond à la qualité de Gemini 2.5 Pro
- ◆Contexte 1M + sortie 65K à 1,50$/9$ — 8 fois moins cher que le modèle phare
- ◆Niveau gratuit disponible avec limites de débit — meilleur modèle gratuit de Google
- ◆Mise en cache du contexte : 0,375$/M — 75% d'économies pour l'entrée en cache
- ◆Multimodal (texte + vision) à vitesse flash — latence typique inférieure à 1s
Avantages
- Intelligence de pointe à prix intermédiaire
- Contexte 1M + sortie 65K
- Niveau gratuit avec limites de débit
Inconvénients
- Plus cher que 3.1 Flash-Lite
- Coût de sortie à 9$/M significatif à grande échelle
- Pas de réglage fin
Performance
Multimodal
Benchmarks
Gemini 3.1 Flash-Lite
LiteTâches à volume élevé et faible latence
Quand l'utiliser: Meilleur modèle économique pour la classification, l'extraction et la génération légère à volume élevé.
Points clés de la mise à niveau
- ◆Contexte de 1M à 0,25$/M d'entrée — 6x moins cher que Gemini 2.5 Flash
- ◆Sortie max de 65K — identique au niveau Pro au prix Lite
- ◆Mise en cache du contexte : 0,0625$/M — 90% d'économies, meilleur rapport qualité-prix
- ◆API par lots : 0,125$/0,75$ — 50% d'économies pour le traitement asynchrone
- ◆Niveau gratuit avec limites de débit — prototypage illimité à coût zéro
Avantages
- Contexte de 1M à 0,25$/M d'entrée — valeur incroyable
- Sortie max de 65K
- 90% d'économies sur la mise en cache du contexte
Inconvénients
- Qualité inférieure à 3.5 Flash pour les tâches complexes
- Pas de réglage fin
- Modèle plus récent, moins éprouvé
Performance
Multimodal
Benchmarks
Gemini 2.5 Pro
FlagshipRaisonnement complexe, long contexte
Quand l'utiliser: Modèle phare au meilleur rapport qualité-prix — 1M de contexte à un coût inférieur à GPT-4.1 ou Claude Sonnet.
Points clés de la mise à niveau
- ◆Entrée phare la moins chère : 1,25 $/M — 40 % moins cher que GPT-4.1
- ◆Fenêtre de contexte de 1M avec sortie de 65K — la plus grande sortie parmi les modèles phares
- ◆Mise en cache du contexte : 0,315 $/M — 75 % d'économies pour les préfixes répétés
- ◆Niveau gratuit disponible — seul modèle phare avec accès gratuit
- ◆MMLU : 85,4 % — compétitif avec GPT-4.1 à moitié prix
Avantages
- Fenêtre de contexte de 1M
- Entrée phare la moins chère à 1,25 $
- Sortie max de 65K
Inconvénients
- Pas d'API batch
- Pas de fine-tuning
- Coût de sortie plus élevé
Performance
Multimodal
Benchmarks
Agents utilisant ce modèle
2Gemini 2.5 Flash
Mid-tierGénération rapide et efficace
Quand l'utiliser: Valeur incroyable pour les applications de production — contexte 1M pour 0,15 $/1M tokens d'entrée.
Points clés de la mise à niveau
- ◆Même contexte 1M que Pro à 1/8 du prix d'entrée (0,15 $ vs 1,25 $/M)
- ◆65K sortie max — identique au niveau Pro pour la capacité de génération
- ◆Mise en cache de contexte : 0,0375 $/M — 97 % d'économies pour les préfixes en cache
- ◆Niveau gratuit avec des limites de débit généreuses — prêt pour la production à coût zéro
- ◆Latence inférieure à la seconde — modèle Google le plus rapide pour les applications en temps réel
Avantages
- Même contexte 1M que Pro à 1/8 du prix
- 65K sortie max
- Meilleures économies d'entrée en cache
Inconvénients
- Pas d'API batch
- Qualité inférieure à Pro pour les tâches difficiles
- Pas de fine-tuning
Performance
Multimodal
Benchmarks
Gemini 2.0 Flash
LiteUltra-rapide, faible coût
Quand l'utiliser: Meilleure option économique pour l'extraction à haut volume, la classification et les modèles fine-tunés.
Points clés de la mise à niveau
- ◆Modèle le moins cher avec 1M de contexte : 0,10 $/M d'entrée — le plus bas du marché
- ◆Seul modèle léger avec fine-tuning + vision — ensemble complet de fonctionnalités
- ◆Mise en cache de contexte : 0,025 $/M — 97,5 % d'économies pour les préfixes répétés
- ◆8K de sortie max est faible — passez à 2.5 Flash pour 65K de sortie
- ◆Support du fine-tuning — idéal pour les modèles de classification spécifiques à un domaine
Avantages
- Modèle le moins cher du marché avec 1M de contexte
- Seul modèle léger avec fine-tuning + vision
- Ensemble complet de fonctionnalités
Inconvénients
- 8K de sortie max est faible
- Seuil de connaissances plus ancien
- Qualité inférieure à 2.5 Flash
Performance
Multimodal
Benchmarks
DiffusionGemma
Mid-tierGénération rapide de texte local, décodage parallèle
Quand l'utiliser: Quand vous avez besoin d'une génération de texte locale rapide sur des GPU grand public et pouvez échanger un peu de qualité contre une vitesse 4 fois supérieure.
Points clés de la mise à niveau
- ◆26B MoE total, 3,8B actifs — fonctionne sur un seul GPU 24 Go
- ◆Génération de texte 4 fois plus rapide via décodage parallèle par diffusion
- ◆Open-source sous Apache 2.0 — déployez partout, affinez librement
- ◆Contexte bidirectionnel permettant l'auto-correction
- ◆Compromis : scores de benchmark inférieurs à Gemma 4 standard
Avantages
- 4 fois plus rapide que Gemma standard grâce au décodage parallèle par diffusion
- 26B MoE avec seulement 3,8B paramètres actifs — tient dans 24 Go de VRAM
- Open-source sous Apache 2.0 — poids complets disponibles
- Contexte bidirectionnel pour l'auto-correction
Inconvénients
- Inférieur à Gemma 4 standard sur tous les benchmarks
- Pas de support vision ou audio
- Pas d'appel de fonction
- Expérimental — pas pour les charges de travail critiques en production
Performance
Multimodal
Benchmarks
Comparaison côte à côte
| Modèle | Niveau | Entrée | Sortie | Contexte |
|---|---|---|---|---|
| Gemini 3.7 Flash | Mid-tier | $0.750 | $3.75 | 1.0M |
| Gemini 3.1 Pro | Flagship | $2.00 | $12.00 | 1M |
| Gemini 3.5 Pro | Flagship | $1.25 | $10.00 | 1M |
| Gemini Omni Flash | Mid-tier | $1.50 | $9.00 | 1M |
| Gemini 3.5 Flash | Mid-tier | $1.50 | $9.00 | 1M |
| Gemini 3.1 Flash-Lite | Lite | $0.250 | $1.50 | 1M |
| Gemini 2.5 Pro | Flagship | $1.25 | $10.00 | 1.0M |
| Gemini 2.5 Flash | Mid-tier | $0.150 | $0.600 | 1.0M |
| Gemini 2.0 Flash | Lite | $0.100 | $0.400 | 1.0M |
| DiffusionGemma | Mid-tier | $0.0000 | $0.0000 | 262K |