Voltar à Zona do Desenvolvedor

Google Modelos

Explore todos os 10 modelos de Google com preços detalhados, prós e contras e recomendações para desenvolvedores.

10
Modelos
$0.0000
Menor Entrada
1.0M
Contexto Máximo
3
Níveis de Qualidade

Recomendações Rápidas

Melhor Custo-Benefício: DiffusionGemma ($0.0000/1M)
Melhor Qualidade: Gemini 3.1 Pro

Gemini 3.7 Flash

NOVOMid-tier

Coding, instruction following

Preços Oficiais

Quando usar: Best pick for high-volume coding assistants, agentic pipelines and tool-calling workloads on a budget.

Destaques da Atualização

  • GA on August 13, 2026 — three weeks after Gemini 3.6 Flash
  • Priced at half of Gemini 3.6 Flash: $0.75 input / $3.75 output per 1M
  • 1,048,576-token context, 65,536-token max output
Preço de Entrada
$0.750
per 1M tokens
Preço de Saída
$3.75
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 1.0M
Saída Máxima: 65,536 tokens
Corte de Conhecimento: 2026-01
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Google's most intelligent Flash model (GA Aug 13, 2026)
  • Purpose-built for coding and agents
  • 1M context at $0.75/$3.75 — half the price of Gemini 3.6 Flash

Contras

  • Below Pro-tier reasoning on the hardest tasks
  • Very new — ecosystem tooling still catching up

Desempenho

Velocidade de saída~120 tok/s
Limite de taxa

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Gemini 3.1 Pro

Flagship

Raciocínio avançado, programação

Preços Oficiais

Quando usar: Melhor modelo do Google para raciocínio complexo e tarefas profissionais de programação.

Destaques da Atualização

  • MMLU: 89,2% — raciocínio significativamente melhorado em relação ao Gemini 2.5 Pro
  • Contexto de 1M com saída de 65K — mesmo contexto, melhor qualidade
  • Desconto de 50% em lote ($1/$6) — lote principal mais barato disponível
  • Cache de contexto: $0,50/M — economia de 75% para prefixos repetidos
  • Pré-visualização apenas paga — sem nível gratuito, mas confiabilidade de nível de produção
Preço de Entrada
$2.00
per 1M tokens
Preço de Saída
$12.00
per 1M tokens
Entrada em Cache
$0.500
per 1M tokens
Entrada em Lote
$1.00
per 1M tokens
Janela de Contexto: 1M
Saída Máxima: 65,536 tokens
Corte de Conhecimento: 2025-06
VisãoChamada de FunçãoAjuste FinoModo JSON

Prós

  • Contexto de 1M com saída de 65K
  • Raciocínio significativamente melhorado em relação ao 3.0
  • Desconto de 50% em lote disponível

Contras

  • Sem nível gratuito (pré-visualização apenas paga)
  • Entrada de contexto longo 2x acima de 200K
  • Ainda em maturação

Desempenho

Velocidade de saída~55 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
89.2%
SWE-bench Verified
68.0%
GPQA
74.5%

Gemini 3.5 Pro

Flagship

Codificação complexa, matemática avançada, raciocínio profundo

Preços Oficiais

Quando usar: Melhor modelo do Google para codificação complexa, matemática avançada e tarefas de raciocínio profundo onde a precisão é mais importante.

Destaques da Atualização

  • Último carro-chefe com raciocínio aprimorado em relação ao 3.1 Pro
  • Contexto de 1M com preços escalonados: $1.25/$10 (≤200K), $2.50/$15 (>200K)
  • Camada gratuita disponível com limites de taxa — único carro-chefe com acesso gratuito
  • Desconto de 50% em lote ($0.625/$5) — carro-chefe de lote mais barato
  • Cache de contexto: $0.315/M — economia de 75% para prefixos repetidos
Preço de Entrada
$1.25
per 1M tokens
Preço de Saída
$10.00
per 1M tokens
Entrada em Cache
$0.315
per 1M tokens
Entrada em Lote
$0.625
per 1M tokens
Janela de Contexto: 1M
Saída Máxima: 65,536 tokens
Corte de Conhecimento: 2026-06
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Contexto de 1M com preços escalonados
  • Melhores benchmarks de raciocínio da categoria
  • Camada gratuita com limites de taxa
  • Desconto de 50% em lote disponível

Contras

  • Contexto longo (>200K) 2x mais caro
  • Sem suporte para ajuste fino
  • Saída inclui tokens de pensamento

Desempenho

Velocidade de saída~50 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
90.5%
SWE-bench Verified
72.0%
GPQA
78.0%

Agentes que usam este modelo

4

Gemini Omni Flash

Mid-tier

Geração multimodal: texto, imagem, áudio e vídeo

Preços Oficiais

Quando usar: Melhor para trabalho criativo multimodal que abrange texto, imagem, áudio e vídeo em um único modelo.

Destaques da Atualização

  • Primeiro modelo de alto nível a unificar nativamente texto, imagem, áudio e vídeo
  • Entrada: $1.50/M para todas as modalidades (texto/imagem/vídeo/áudio)
  • Saída de texto: $9/M — Saída de vídeo: $17.50/M (~$0.10/seg a 720p)
  • Permite fluxos de trabalho criativos agentivos e edição de vídeo em tempo real
Preço de Entrada
$1.50
per 1M tokens
Preço de Saída
$9.00
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 1M
Saída Máxima: 65,536 tokens
Corte de Conhecimento: 2026-06
VisãoChamada de FunçãoAjuste FinoModo JSON

Prós

  • Primeiro modelo nativamente unificado de texto/imagem/áudio/vídeo
  • Manipulação de vídeo em tempo real
  • $1.50/M de entrada para todas as modalidades
  • Fluxos de trabalho criativos agentivos

Contras

  • Saída de vídeo a $17.50/M é cara
  • Sem nível gratuito
  • Pré-visualização — pode mudar

Desempenho

Velocidade de saída~60 tok/s
Limite de taxa3,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Gemini 3.5 Flash

Mid-tier

Geração rápida e inteligente

Preços Oficiais

Quando usar: Melhor equilíbrio entre velocidade e inteligência para aplicações de produção que precisam de capacidade multimodal.

Destaques da Atualização

  • Inteligência de ponta a preço médio — iguala qualidade do Gemini 2.5 Pro
  • Contexto de 1M + saída de 65K a $1.50/$9 — 8x mais barato que o principal
  • Camada gratuita disponível com limites de taxa — melhor modelo gratuito do Google
  • Cache de contexto: $0.375/M — 75% de economia para entrada em cache
  • Multimodal (texto + visão) em velocidade flash — latência típica abaixo de 1s
Preço de Entrada
$1.50
per 1M tokens
Preço de Saída
$9.00
per 1M tokens
Entrada em Cache
$0.375
per 1M tokens
Entrada em Lote
$0.750
per 1M tokens
Janela de Contexto: 1M
Saída Máxima: 65,536 tokens
Corte de Conhecimento: 2025-06
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Inteligência de ponta a preço médio
  • Contexto de 1M + saída de 65K
  • Camada gratuita com limites de taxa

Contras

  • Mais caro que o 3.1 Flash-Lite
  • Custo de saída a $9/M é significativo em escala
  • Sem ajuste fino

Desempenho

Velocidade de saída~95 tok/s
Limite de taxa10,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
86.5%
HumanEval
85.0%
MATH
73.0%

Gemini 3.1 Flash-Lite

Lite

Tarefas de alto volume e baixa latência

Preços Oficiais

Quando usar: Melhor modelo de baixo custo para classificação, extração e geração leve de alto volume.

Destaques da Atualização

  • Contexto de 1M a $0,25/M de entrada — 6x mais barato que Gemini 2.5 Flash
  • 65K de saída máxima — igual ao nível Pro com preço Lite
  • Cache de contexto: $0,0625/M — 90% de economia, melhor valor de cache
  • API em lote: $0,125/$0,75 — 50% de economia para processamento assíncrono
  • Nível gratuito com limites de taxa — prototipagem ilimitada a custo zero
Preço de Entrada
$0.250
per 1M tokens
Preço de Saída
$1.50
per 1M tokens
Entrada em Cache
$0.063
per 1M tokens
Entrada em Lote
$0.125
per 1M tokens
Janela de Contexto: 1M
Saída Máxima: 65,536 tokens
Corte de Conhecimento: 2025-04
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Contexto de 1M a $0,25/M de entrada — valor incrível
  • 65K de saída máxima
  • 90% de economia com cache de contexto

Contras

  • Qualidade abaixo do 3.5 Flash para tarefas complexas
  • Sem ajuste fino
  • Modelo mais novo, menos testado

Desempenho

Velocidade de saída~130 tok/s
Limite de taxa15,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
79.0%
HumanEval
74.5%

Gemini 2.5 Pro

Flagship

Raciocínio complexo, contexto longo

Preços Oficiais

Quando usar: Modelo principal com melhor custo-benefício — contexto de 1M a um custo menor que GPT-4.1 ou Claude Sonnet.

Destaques da Atualização

  • Entrada principal mais barata: $1,25/M — 40% mais barato que GPT-4.1
  • Janela de contexto de 1M com saída de 65K — maior saída entre os principais
  • Cache de contexto: $0,315/M — economia de 75% para prefixos repetidos
  • Camada gratuita disponível — único modelo principal com acesso gratuito
  • MMLU: 85,4% — competitivo com GPT-4.1 pela metade do custo
Preço de Entrada
$1.25
per 1M tokens
Preço de Saída
$10.00
per 1M tokens
Entrada em Cache
$0.315
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 1.0M
Saída Máxima: 65,536 tokens
Corte de Conhecimento: 2025-01
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Janela de contexto de 1M
  • Entrada principal mais barata a $1,25
  • Saída máxima de 65K

Contras

  • Sem API em lote
  • Sem ajuste fino
  • Custo de saída mais alto

Desempenho

Velocidade de saída~50 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
85.4%
SWE-bench Verified
63.8%
MATH
72.0%

Agentes que usam este modelo

2

Gemini 2.5 Flash

Mid-tier

Geração rápida e eficiente

Preços Oficiais

Quando usar: Valor incrível para aplicações de produção — contexto de 1M por $0,15/1M tokens de entrada.

Destaques da Atualização

  • Mesmo contexto de 1M que o Pro por 1/8 do preço de entrada ($0,15 vs $1,25/M)
  • 65K de saída máxima — idêntico ao nível Pro para capacidade de geração
  • Cache de contexto: $0,0375/M — 97% de economia para prefixos em cache
  • Nível gratuito com limites de taxa generosos — pronto para produção a custo zero
  • Latência abaixo de um segundo — modelo mais rápido do Google para aplicações em tempo real
Preço de Entrada
$0.150
per 1M tokens
Preço de Saída
$0.600
per 1M tokens
Entrada em Cache
$0.037
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 1.0M
Saída Máxima: 65,536 tokens
Corte de Conhecimento: 2025-01
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Mesmo contexto de 1M que o Pro por 1/8 do preço
  • 65K de saída máxima
  • Melhores economias em cache de entrada

Contras

  • Sem API em lote
  • Qualidade inferior ao Pro para tarefas difíceis
  • Sem ajuste fino

Desempenho

Velocidade de saída~100 tok/s
Limite de taxa10,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
83.0%
HumanEval
82.5%
MATH
68.0%

Agentes que usam este modelo

4

Gemini 2.0 Flash

Lite

Ultra-rápido, baixo custo

Preços Oficiais

Quando usar: Melhor opção de baixo custo para extração em alto volume, classificação e modelos ajustados.

Destaques da Atualização

  • Modelo mais barato com contexto de 1M: $0,10/M de entrada — o mais baixo do mercado
  • Único modelo leve com ajuste fino + visão — conjunto completo de recursos
  • Cache de contexto: $0,025/M — economia de 97,5% para prefixos repetidos
  • Saída máxima de 8K é baixa — atualize para 2.5 Flash para saída de 65K
  • Suporte a ajuste fino — melhor para modelos de classificação específicos de domínio
Preço de Entrada
$0.100
per 1M tokens
Preço de Saída
$0.400
per 1M tokens
Entrada em Cache
$0.025
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 1.0M
Saída Máxima: 8,192 tokens
Corte de Conhecimento: 2024-08
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Modelo mais barato do mercado com contexto de 1M
  • Único modelo leve com ajuste fino + visão
  • Conjunto completo de recursos

Contras

  • Saída máxima de 8K é baixa
  • Corte de conhecimento mais antigo
  • Qualidade abaixo do 2.5 Flash

Desempenho

Velocidade de saída~140 tok/s
Limite de taxa15,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
78.5%
HumanEval
75.0%
MATH
62.0%

DiffusionGemma

Mid-tier

Geração rápida de texto local, decodificação paralela

Preços Oficiais

Quando usar: Quando você precisa de geração rápida de texto local em GPUs de consumo e pode trocar alguma qualidade por velocidade 4x.

Destaques da Atualização

  • 26B total MoE, 3,8B ativos — roda em uma única GPU de 24GB
  • Geração de texto 4x mais rápida via decodificação paralela baseada em difusão
  • Apache 2.0 código aberto — implante em qualquer lugar, ajuste livremente
  • Contexto bidirecional permite autocorreção
  • Compensação: pontuações de benchmark mais baixas em comparação com o Gemma 4 padrão
Preço de Entrada
$0.0000
per 1M tokens
Preço de Saída
$0.0000
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 262K
Saída Máxima: 32,768 tokens
Corte de Conhecimento: 2025-06
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • 4x mais rápido que o Gemma padrão via decodificação de difusão paralela
  • 26B MoE com apenas 3,8B parâmetros ativos — cabe em 24GB VRAM
  • Código aberto sob Apache 2.0 — pesos completos disponíveis
  • Contexto bidirecional para autocorreção

Contras

  • Fica atrás do Gemma 4 padrão em todos os benchmarks
  • Sem suporte para visão ou áudio
  • Sem chamada de funções
  • Experimental — não para cargas de trabalho críticas de produção

Desempenho

Velocidade de saída~200 tok/s
Limite de taxa

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
72.0%
HumanEval
68.0%

Comparação Lado a Lado

ModeloNívelEntradaSaídaContexto
Gemini 3.7 FlashMid-tier$0.750$3.751.0M
Gemini 3.1 ProFlagship$2.00$12.001M
Gemini 3.5 ProFlagship$1.25$10.001M
Gemini Omni FlashMid-tier$1.50$9.001M
Gemini 3.5 FlashMid-tier$1.50$9.001M
Gemini 3.1 Flash-LiteLite$0.250$1.501M
Gemini 2.5 ProFlagship$1.25$10.001.0M
Gemini 2.5 FlashMid-tier$0.150$0.6001.0M
Gemini 2.0 FlashLite$0.100$0.4001.0M
DiffusionGemmaMid-tier$0.0000$0.0000262K