Google Modelos
Explore todos os 10 modelos de Google com preços detalhados, prós e contras e recomendações para desenvolvedores.
Recomendações Rápidas
Gemini 3.7 Flash
NOVOMid-tierCoding, instruction following
Quando usar: Best pick for high-volume coding assistants, agentic pipelines and tool-calling workloads on a budget.
Destaques da Atualização
- ◆GA on August 13, 2026 — three weeks after Gemini 3.6 Flash
- ◆Priced at half of Gemini 3.6 Flash: $0.75 input / $3.75 output per 1M
- ◆1,048,576-token context, 65,536-token max output
Prós
- Google's most intelligent Flash model (GA Aug 13, 2026)
- Purpose-built for coding and agents
- 1M context at $0.75/$3.75 — half the price of Gemini 3.6 Flash
Contras
- Below Pro-tier reasoning on the hardest tasks
- Very new — ecosystem tooling still catching up
Desempenho
Multimodal
Gemini 3.1 Pro
FlagshipRaciocínio avançado, programação
Quando usar: Melhor modelo do Google para raciocínio complexo e tarefas profissionais de programação.
Destaques da Atualização
- ◆MMLU: 89,2% — raciocínio significativamente melhorado em relação ao Gemini 2.5 Pro
- ◆Contexto de 1M com saída de 65K — mesmo contexto, melhor qualidade
- ◆Desconto de 50% em lote ($1/$6) — lote principal mais barato disponível
- ◆Cache de contexto: $0,50/M — economia de 75% para prefixos repetidos
- ◆Pré-visualização apenas paga — sem nível gratuito, mas confiabilidade de nível de produção
Prós
- Contexto de 1M com saída de 65K
- Raciocínio significativamente melhorado em relação ao 3.0
- Desconto de 50% em lote disponível
Contras
- Sem nível gratuito (pré-visualização apenas paga)
- Entrada de contexto longo 2x acima de 200K
- Ainda em maturação
Desempenho
Multimodal
Benchmarks
Gemini 3.5 Pro
FlagshipCodificação complexa, matemática avançada, raciocínio profundo
Quando usar: Melhor modelo do Google para codificação complexa, matemática avançada e tarefas de raciocínio profundo onde a precisão é mais importante.
Destaques da Atualização
- ◆Último carro-chefe com raciocínio aprimorado em relação ao 3.1 Pro
- ◆Contexto de 1M com preços escalonados: $1.25/$10 (≤200K), $2.50/$15 (>200K)
- ◆Camada gratuita disponível com limites de taxa — único carro-chefe com acesso gratuito
- ◆Desconto de 50% em lote ($0.625/$5) — carro-chefe de lote mais barato
- ◆Cache de contexto: $0.315/M — economia de 75% para prefixos repetidos
Prós
- Contexto de 1M com preços escalonados
- Melhores benchmarks de raciocínio da categoria
- Camada gratuita com limites de taxa
- Desconto de 50% em lote disponível
Contras
- Contexto longo (>200K) 2x mais caro
- Sem suporte para ajuste fino
- Saída inclui tokens de pensamento
Desempenho
Multimodal
Benchmarks
Agentes que usam este modelo
4Gemini Omni Flash
Mid-tierGeração multimodal: texto, imagem, áudio e vídeo
Quando usar: Melhor para trabalho criativo multimodal que abrange texto, imagem, áudio e vídeo em um único modelo.
Destaques da Atualização
- ◆Primeiro modelo de alto nível a unificar nativamente texto, imagem, áudio e vídeo
- ◆Entrada: $1.50/M para todas as modalidades (texto/imagem/vídeo/áudio)
- ◆Saída de texto: $9/M — Saída de vídeo: $17.50/M (~$0.10/seg a 720p)
- ◆Permite fluxos de trabalho criativos agentivos e edição de vídeo em tempo real
Prós
- Primeiro modelo nativamente unificado de texto/imagem/áudio/vídeo
- Manipulação de vídeo em tempo real
- $1.50/M de entrada para todas as modalidades
- Fluxos de trabalho criativos agentivos
Contras
- Saída de vídeo a $17.50/M é cara
- Sem nível gratuito
- Pré-visualização — pode mudar
Desempenho
Multimodal
Gemini 3.5 Flash
Mid-tierGeração rápida e inteligente
Quando usar: Melhor equilíbrio entre velocidade e inteligência para aplicações de produção que precisam de capacidade multimodal.
Destaques da Atualização
- ◆Inteligência de ponta a preço médio — iguala qualidade do Gemini 2.5 Pro
- ◆Contexto de 1M + saída de 65K a $1.50/$9 — 8x mais barato que o principal
- ◆Camada gratuita disponível com limites de taxa — melhor modelo gratuito do Google
- ◆Cache de contexto: $0.375/M — 75% de economia para entrada em cache
- ◆Multimodal (texto + visão) em velocidade flash — latência típica abaixo de 1s
Prós
- Inteligência de ponta a preço médio
- Contexto de 1M + saída de 65K
- Camada gratuita com limites de taxa
Contras
- Mais caro que o 3.1 Flash-Lite
- Custo de saída a $9/M é significativo em escala
- Sem ajuste fino
Desempenho
Multimodal
Benchmarks
Gemini 3.1 Flash-Lite
LiteTarefas de alto volume e baixa latência
Quando usar: Melhor modelo de baixo custo para classificação, extração e geração leve de alto volume.
Destaques da Atualização
- ◆Contexto de 1M a $0,25/M de entrada — 6x mais barato que Gemini 2.5 Flash
- ◆65K de saída máxima — igual ao nível Pro com preço Lite
- ◆Cache de contexto: $0,0625/M — 90% de economia, melhor valor de cache
- ◆API em lote: $0,125/$0,75 — 50% de economia para processamento assíncrono
- ◆Nível gratuito com limites de taxa — prototipagem ilimitada a custo zero
Prós
- Contexto de 1M a $0,25/M de entrada — valor incrível
- 65K de saída máxima
- 90% de economia com cache de contexto
Contras
- Qualidade abaixo do 3.5 Flash para tarefas complexas
- Sem ajuste fino
- Modelo mais novo, menos testado
Desempenho
Multimodal
Benchmarks
Gemini 2.5 Pro
FlagshipRaciocínio complexo, contexto longo
Quando usar: Modelo principal com melhor custo-benefício — contexto de 1M a um custo menor que GPT-4.1 ou Claude Sonnet.
Destaques da Atualização
- ◆Entrada principal mais barata: $1,25/M — 40% mais barato que GPT-4.1
- ◆Janela de contexto de 1M com saída de 65K — maior saída entre os principais
- ◆Cache de contexto: $0,315/M — economia de 75% para prefixos repetidos
- ◆Camada gratuita disponível — único modelo principal com acesso gratuito
- ◆MMLU: 85,4% — competitivo com GPT-4.1 pela metade do custo
Prós
- Janela de contexto de 1M
- Entrada principal mais barata a $1,25
- Saída máxima de 65K
Contras
- Sem API em lote
- Sem ajuste fino
- Custo de saída mais alto
Desempenho
Multimodal
Benchmarks
Agentes que usam este modelo
2Gemini 2.5 Flash
Mid-tierGeração rápida e eficiente
Quando usar: Valor incrível para aplicações de produção — contexto de 1M por $0,15/1M tokens de entrada.
Destaques da Atualização
- ◆Mesmo contexto de 1M que o Pro por 1/8 do preço de entrada ($0,15 vs $1,25/M)
- ◆65K de saída máxima — idêntico ao nível Pro para capacidade de geração
- ◆Cache de contexto: $0,0375/M — 97% de economia para prefixos em cache
- ◆Nível gratuito com limites de taxa generosos — pronto para produção a custo zero
- ◆Latência abaixo de um segundo — modelo mais rápido do Google para aplicações em tempo real
Prós
- Mesmo contexto de 1M que o Pro por 1/8 do preço
- 65K de saída máxima
- Melhores economias em cache de entrada
Contras
- Sem API em lote
- Qualidade inferior ao Pro para tarefas difíceis
- Sem ajuste fino
Desempenho
Multimodal
Benchmarks
Gemini 2.0 Flash
LiteUltra-rápido, baixo custo
Quando usar: Melhor opção de baixo custo para extração em alto volume, classificação e modelos ajustados.
Destaques da Atualização
- ◆Modelo mais barato com contexto de 1M: $0,10/M de entrada — o mais baixo do mercado
- ◆Único modelo leve com ajuste fino + visão — conjunto completo de recursos
- ◆Cache de contexto: $0,025/M — economia de 97,5% para prefixos repetidos
- ◆Saída máxima de 8K é baixa — atualize para 2.5 Flash para saída de 65K
- ◆Suporte a ajuste fino — melhor para modelos de classificação específicos de domínio
Prós
- Modelo mais barato do mercado com contexto de 1M
- Único modelo leve com ajuste fino + visão
- Conjunto completo de recursos
Contras
- Saída máxima de 8K é baixa
- Corte de conhecimento mais antigo
- Qualidade abaixo do 2.5 Flash
Desempenho
Multimodal
Benchmarks
DiffusionGemma
Mid-tierGeração rápida de texto local, decodificação paralela
Quando usar: Quando você precisa de geração rápida de texto local em GPUs de consumo e pode trocar alguma qualidade por velocidade 4x.
Destaques da Atualização
- ◆26B total MoE, 3,8B ativos — roda em uma única GPU de 24GB
- ◆Geração de texto 4x mais rápida via decodificação paralela baseada em difusão
- ◆Apache 2.0 código aberto — implante em qualquer lugar, ajuste livremente
- ◆Contexto bidirecional permite autocorreção
- ◆Compensação: pontuações de benchmark mais baixas em comparação com o Gemma 4 padrão
Prós
- 4x mais rápido que o Gemma padrão via decodificação de difusão paralela
- 26B MoE com apenas 3,8B parâmetros ativos — cabe em 24GB VRAM
- Código aberto sob Apache 2.0 — pesos completos disponíveis
- Contexto bidirecional para autocorreção
Contras
- Fica atrás do Gemma 4 padrão em todos os benchmarks
- Sem suporte para visão ou áudio
- Sem chamada de funções
- Experimental — não para cargas de trabalho críticas de produção
Desempenho
Multimodal
Benchmarks
Comparação Lado a Lado
| Modelo | Nível | Entrada | Saída | Contexto |
|---|---|---|---|---|
| Gemini 3.7 Flash | Mid-tier | $0.750 | $3.75 | 1.0M |
| Gemini 3.1 Pro | Flagship | $2.00 | $12.00 | 1M |
| Gemini 3.5 Pro | Flagship | $1.25 | $10.00 | 1M |
| Gemini Omni Flash | Mid-tier | $1.50 | $9.00 | 1M |
| Gemini 3.5 Flash | Mid-tier | $1.50 | $9.00 | 1M |
| Gemini 3.1 Flash-Lite | Lite | $0.250 | $1.50 | 1M |
| Gemini 2.5 Pro | Flagship | $1.25 | $10.00 | 1.0M |
| Gemini 2.5 Flash | Mid-tier | $0.150 | $0.600 | 1.0M |
| Gemini 2.0 Flash | Lite | $0.100 | $0.400 | 1.0M |
| DiffusionGemma | Mid-tier | $0.0000 | $0.0000 | 262K |