OpenAI Modelos
Explore todos os 16 modelos de OpenAI com preços detalhados, prós e contras e recomendações para desenvolvedores.
Recomendações Rápidas
GPT-5.6 Sol
NOVOFlagshipAgentic coding, complex workloads
Quando usar: Best for frontier agentic coding, deep research and mission-critical workloads where accuracy matters most.
Destaques da Atualização
- ◆GPT-5.6 flagship tier — released July 9, 2026
- ◆Price held at $5/$30 while Terra and Luna were cut on July 30
- ◆1.05M context, 128K max output, cache reads at $0.50/M (90% off)
Prós
- Flagship tier of the GPT-5.6 family (launched Jul 9, 2026)
- 1.05M shared context window with 128K max output
- Fast mode available at 2x base price
- Explicit cache breakpoints with 30-min minimum cache life
Contras
- Output still costs $30/M tokens
- No fine-tuning support yet
Desempenho
Multimodal
GPT-5.6 Terra
NOVOMid-tierBalanced performance & cost
Quando usar: The default choice for production apps, agents and high-value everyday workloads.
Destaques da Atualização
- ◆Price cut 20% on July 30, 2026: $2.50 → $2 input, $15 → $12 output
- ◆Cache reads at $0.20/M (90% off input)
- ◆1.05M context, 128K max output — same window as Sol
Prós
- Everyday default tier of GPT-5.6
- 20% price cut on Jul 30, 2026 ($2.50/$15 → $2/$12)
- Same 1.05M context as Sol at less than half the price
Contras
- Below Sol-level accuracy on the hardest tasks
- No Fast mode
Desempenho
Multimodal
GPT-5.6 Luna
NOVOLiteHigh-volume, low-latency tasks
Quando usar: Ideal for chatbots, classification, extraction, batch jobs and any high-volume latency-sensitive workload.
Destaques da Atualização
- ◆Price slashed 80% on July 30, 2026: $1 → $0.20 input, $6 → $1.20 output
- ◆Cache reads at $0.02/M — among the cheapest frontier-family caches
- ◆~1/25 of Sol list price for high-volume work
Prós
- Fastest and most affordable GPT-5.6 tier
- 80% price cut on Jul 30, 2026 ($1/$6 → $0.20/$1.20)
- Full 1.05M context at budget price
Contras
- Lowest capability tier of the family
- Not suited for deep reasoning tasks
Desempenho
Multimodal
GPT-5.5
FlagshipCodificação agêntica, cargas de trabalho complexas
Quando usar: Melhor para agentes de codificação complexos, uso em computador e cargas de trabalho profissionais onde a precisão é mais importante.
Destaques da Atualização
- ◆SWE-bench Verificado: 82,7% (+6,5pp vs 76,2% do GPT-5.4)
- ◆Terminal-Bench: 82,7% — novo SOTA para codificação agêntica
- ◆Janela de contexto de 1M mantida, 33% menos tokens que o GPT-5.4 na mesma latência
- ◆Raciocínio científico GeneBench: 28,5% (+3,2pp sobre GPT-5.4)
- ◆Preço: $5/$30 — 2x GPT-5.4, mas entrada em cache 90% mais barata a $0,50/M
Prós
- Codificação agêntica de última geração (82,7% Terminal-Bench)
- Janela de contexto de 1 milhão de tokens
- Iguala a latência do GPT-5.4 com menos tokens
- Forte capacidade de pesquisa científica
Contras
- 2x mais caro que o GPT-5.4
- Ainda sem suporte para fine-tuning
- Custo de saída: $30/M tokens
Desempenho
Multimodal
Benchmarks
Agentes que usam este modelo
7GPT-5.5 Pro
ReasoningPrecisão premium, computação paralela
Quando usar: Use quando precisar de máxima precisão para análises jurídicas, médicas ou científicas e o custo for secundário.
Destaques da Atualização
- ◆Computação paralela em tempo de teste: executa múltiplos caminhos de raciocínio, escolhe o melhor
- ◆GeneBench (raciocínio científico): 33,2% — o maior já registrado
- ◆Alocação dedicada de GPU para assinantes Pro/Business/Enterprise
- ◆Mesmo contexto de 1M + saída de 128K que o GPT-5.5 base, mas com raciocínio mais profundo
- ◆Prêmio de preço de 6x ($30/$180) — justificado apenas para análises críticas
Prós
- Maior precisão via computação paralela em tempo de teste
- 33,2% no GeneBench (raciocínio científico)
- Alocação dedicada de GPU para assinantes Pro
Contras
- 6x mais caro que o GPT-5.5 base
- Sem suporte para API em lote
- Apenas para níveis Pro/Business/Enterprise
Desempenho
Multimodal
Benchmarks
GPT-5.5 Turbo
Mid-tierAplicativos de alto volume, chatbots, inferência rápida
Quando usar: Melhor para aplicativos de produção de alto volume que precisam da qualidade GPT-5.5 a custo menor — chatbots, resumos, classificação.
Destaques da Atualização
- ◆Qualidade de classe GPT-5.5 com custo de saída ~33% menor ($20 vs $30/M)
- ◆Janela de contexto de 200K — suficiente para a maioria dos casos de uso em produção
- ◆Inferência rápida: 1,5x mais rápida que GPT-5.5 para aplicações em tempo real
- ◆Mesmo máximo de saída de 128K que GPT-5.5 base
- ◆Camada gratuita disponível — melhor valor para implantações de alto volume
Prós
- Inteligência de classe GPT-5.5 a custo menor
- Janela de contexto de 200K
- Saída 33% mais barata que GPT-5.5
- Inferência rápida para aplicativos em tempo real
Contras
- Contexto menor em comparação com GPT-5.5 (200K vs 1M)
- Sem suporte para ajuste fino
- Precisão de raciocínio ligeiramente inferior
Desempenho
Multimodal
Benchmarks
GPT-5.4
FlagshipCodificação, uso de computador, trabalho de conhecimento
Quando usar: Excelente versátil para assistentes de codificação, automação de desktop e trabalho de conhecimento empresarial.
Destaques da Atualização
- ◆OSWorld: 75% — primeira IA a superar a automação de desktop em nível humano
- ◆33% menos erros factuais vs GPT-5.2 (redução de alucinação)
- ◆Tool Search: descobre ferramentas dinamicamente, reduz o uso de tokens do agente em ~40%
- ◆Contexto: 128K → 1M tokens (aumento de 8x em relação ao GPT-4o)
- ◆Saída máxima: 16K → 128K tokens (aumento de 8x), preço $2.50/$15
Prós
- Primeira IA a superar o desempenho humano em desktop (75% OSWorld)
- Codificação unificada + uso de computador + trabalho de conhecimento
- 33% menos erros factuais que o GPT-5.2
- Tool Search reduz o uso de tokens para agentes
Contras
- Mais caro que o GPT-4.1
- Ainda sem ajuste fino
- Preço de entrada dobra acima de 272K de contexto
Desempenho
Multimodal
Benchmarks
GPT-5.4 Mini
Mid-tierCodificação econômica e tarefas de desenvolvimento
Quando usar: Melhor custo-benefício para tarefas de codificação de alto volume, chatbots e cargas de trabalho de desenvolvimento mais leves.
Destaques da Atualização
- ◆SWE-bench Pro: 54,38% — apenas 3,3 pp abaixo dos 57,7% do GPT-5.4 Standard
- ◆6x mais barato que o GPT-5.4 Standard ($0,75 vs $5/M de entrada)
- ◆Janela de contexto de 400K — suficiente para a maioria das tarefas de codificação
- ◆Mesmo máximo de saída de 128K que o principal, 90% de economia em entrada em cache
- ◆Lançado 12 dias após o Standard — a variante mini mais rápida de sempre
Prós
- 54,38% SWE-bench Pro (próximo dos 57,7% do Standard)
- 6x mais barato que o GPT-5.4 Standard
- Janela de contexto de 400K
- Acesso gratuito disponível
Contras
- Qualidade de raciocínio inferior ao Standard
- Janela de contexto menor que o total de 1M
- Lançado 12 dias após o Standard
Desempenho
Multimodal
Benchmarks
GPT-5.4 Nano
LiteEdge, embarcado, mobile
Quando usar: Ideal para assistentes em dispositivos, aplicativos móveis e cenários onde a latência de rede é uma preocupação.
Destaques da Atualização
- ◆Projetado para edge/mobile/IoT — otimizado para inferência no dispositivo
- ◆Saída máxima de 128K com contexto de 272K — maior relação saída/contexto
- ◆Visão + chamada de funções por $0,20/M de entrada — antes exclusivo de modelos flagship
- ◆Latência otimizada para interações móveis em tempo real
- ◆Contexto de 272K vs 1M para Standard — trade-off entre velocidade e custo
Prós
- Custo ultrabaixo para implantações edge
- Projetado para dispositivos móveis e IoT
- Saída máxima de 128K apesar do tamanho reduzido
Contras
- Benchmarks limitados disponíveis
- Janela de contexto menor
- Lacuna de qualidade para tarefas complexas
Desempenho
Multimodal
Benchmarks
GPT-4o
FlagshipPropósito geral, multimodal
Quando usar: Melhor escolha padrão para a maioria dos aplicativos que exigem saída multimodal de alta qualidade.
Destaques da Atualização
- ◆Primeiro modelo nativamente multimodal: texto + imagem + áudio em um único modelo
- ◆2x mais rápido que GPT-4 Turbo com 50% menos custo ($2,50 vs $5/M de entrada)
- ◆Compreensão nativa de áudio — sem necessidade de pipeline separado do Whisper
- ◆Suporte a fine-tuning para adaptação de domínio (exclusivo do modelo principal)
- ◆Contexto de 128K — substituído pelo 1M do GPT-4.1 para tarefas de documentos longos
Prós
- Multimodal (texto + imagem + áudio)
- Qualidade excelente para uso geral
- Chamada de função forte e modo JSON
Contras
- Custo mais alto que variantes mini/nano
- Contexto de 128K vs 1M+ para modelos 4.1 mais recentes
Desempenho
Multimodal
Benchmarks
Agentes que usam este modelo
3GPT-4o Mini
LiteTarefas rápidas e econômicas
Quando usar: Ótimo para cargas de trabalho de alto volume e sensíveis a custos, como chatbots e sumarização.
Destaques da Atualização
- ◆Substituiu o GPT-3.5 Turbo: 46% mais barato, qualidade significativamente melhor
- ◆Mesmo contexto de 128K que o GPT-4o por 1/17 do preço
- ◆Pontuação de 82% no MMLU — aproximando-se do nível GPT-4 em tarefas de conhecimento
- ◆Visão + chamada de funções por US$ 0,15/M — recursos anteriormente exclusivos do carro-chefe
- ◆Ajuste fino disponível — melhor relação custo/qualidade para modelos ajustados
Prós
- Extremamente acessível
- Mesmo contexto de 128K que o GPT-4o
- Suporta visão + chamada de funções
Contras
- Qualidade de raciocínio inferior à do carro-chefe
- Não é ideal para tarefas complexas de várias etapas
Desempenho
Multimodal
Benchmarks
GPT-4.1
FlagshipCodificação, seguimento de instruções
Quando usar: Melhor escolha para assistentes de codificação e análise de documentos longos.
Destaques da Atualização
- ◆Contexto: 128K → 1M tokens (salto de 8x em relação ao GPT-4o)
- ◆SWE-bench Verificado: 54,6% — melhor pontuação de codificação no lançamento
- ◆Saída máxima: 32K tokens (2x os 16K do GPT-4o)
- ◆Seguimento de instruções: 40% melhor no IFEval em comparação com GPT-4o
- ◆Mais barato que GPT-4o ($2 vs $2,50/M entrada) com mais capacidade
Prós
- Janela de contexto de 1 milhão de tokens
- Melhor capacidade de codificação da categoria
- Mais barato que GPT-4o com melhor contexto
Contras
- Mais lento que mini/nano para tarefas simples
- Modelo mais novo, menos testado
Desempenho
Multimodal
Benchmarks
Agentes que usam este modelo
82GPT-4.1 Mini
Mid-tierDesempenho equilibrado e custo
Quando usar: Ponto ideal para aplicações de produção que precisam de contexto longo sem custos de carro-chefe.
Destaques da Atualização
- ◆Contexto de 1M a $0,40/M de entrada — 5x mais barato que o carro-chefe GPT-4.1
- ◆Mesmo contexto de 1M + saída de 32K que o carro-chefe para uso em produção
- ◆Suporte multimodal completo (visão, chamada de função, ajuste fino)
- ◆SWE-bench: 42,8% — codificação forte a preço intermediário
- ◆Substituiu o GPT-4o Mini para cargas de trabalho de produção de contexto longo
Prós
- Contexto de 1M a preço intermediário
- Codificação forte pelo preço
- Suporte multimodal completo
Contras
- Diferença de qualidade em relação ao carro-chefe para raciocínio complexo
- Ainda mais caro que o nano
Desempenho
Multimodal
Benchmarks
GPT-4.1 Nano
LiteDispositivos de borda com latência ultrabaixa
Quando usar: Ideal para classificação em tempo real, extração e pipelines de alto rendimento.
Destaques da Atualização
- ◆Modelo mais barato com contexto de 1M: $0,10/M de entrada (GPT-3.5 Turbo era $0,50)
- ◆Conjunto completo de recursos no nível leve: visão + chamada de função + ajuste fino
- ◆Contexto: 128K → 1M (aumento de 8x em relação aos 128K do GPT-4o Mini)
- ◆Tempos de resposta mais rápidos da linha OpenAI — latência típica abaixo de 200ms
- ◆Entrada em cache a $0,025/M — economia de 97,5% para prefixos repetidos
Prós
- Modelo OpenAI mais barato com contexto de 1M
- Tempos de resposta mais rápidos
- Conjunto completo de recursos (visão, FC, ajuste fino)
Contras
- Queda perceptível de qualidade para tarefas complexas
- Não adequado para raciocínio profundo
Desempenho
Multimodal
Benchmarks
o3
ReasoningRaciocínio complexo, matemática, ciência
Quando usar: Use para problemas que exigem raciocínio passo a passo, provas matemáticas e análise científica.
Destaques da Atualização
- ◆ARC-AGI: 87,5% — quase humano em tarefas abstratas de raciocínio
- ◆Saída máxima: 100K tokens (4x os 25K do o1) para cadeia de pensamento profunda
- ◆Visão + chamada de função — novas capacidades em comparação ao o1 apenas texto
- ◆Olimpíada de Matemática: Nível de medalha de ouro no AIME 2024 (93,3%)
- ◆Preço: $2/$8 — 1/3 do custo do o1 Pro a $200/M
Prós
- Capacidade de raciocínio de ponta
- Saída máxima de 100K para cadeia de pensamento longa
- Excelente em matemática e ciência
Contras
- Mais lento devido ao tempo de pensamento
- Sem suporte para ajuste fino
- Custo mais alto para tokens de raciocínio
Desempenho
Multimodal
Benchmarks
Agentes que usam este modelo
1o4-mini
ReasoningRaciocínio a menor custo
Quando usar: Melhor valor para cargas de trabalho de raciocínio — ótimo para produção onde o3 é exagerado.
Destaques da Atualização
- ◆55% mais barato que o3 ($1,10 vs $2/M de entrada) para tarefas de raciocínio
- ◆Mesmo máximo de 100K de saída que o3 — sem compromisso na profundidade do raciocínio
- ◆Inferência mais rápida que o3 com orçamento de pensamento otimizado
- ◆Visão + chamada de função no nível de raciocínio — anteriormente exclusivo do o3
- ◆Entrada em cache: $0,275/M — 75% de economia para prompts repetidos
Prós
- 55% mais barato que o3 para raciocínio
- Mesmo máximo de 100K de saída
- Mais rápido que o3
Contras
- Menos capaz que o3 nos problemas mais difíceis
- Sem ajuste fino
- Tokens de raciocínio adicionam custo oculto
Desempenho
Multimodal
Benchmarks
Agentes que usam este modelo
1Comparação Lado a Lado
| Modelo | Nível | Entrada | Saída | Contexto |
|---|---|---|---|---|
| GPT-5.6 Sol | Flagship | $5.00 | $30.00 | 1.1M |
| GPT-5.6 Terra | Mid-tier | $2.00 | $12.00 | 1.1M |
| GPT-5.6 Luna | Lite | $0.200 | $1.20 | 1.1M |
| GPT-5.5 | Flagship | $5.00 | $30.00 | 1M |
| GPT-5.5 Pro | Reasoning | $30.00 | $180.00 | 1M |
| GPT-5.5 Turbo | Mid-tier | $5.00 | $20.00 | 200K |
| GPT-5.4 | Flagship | $2.50 | $15.00 | 1M |
| GPT-5.4 Mini | Mid-tier | $0.750 | $4.50 | 400K |
| GPT-5.4 Nano | Lite | $0.200 | $1.25 | 272K |
| GPT-4o | Flagship | $2.50 | $10.00 | 128K |
| GPT-4o Mini | Lite | $0.150 | $0.600 | 128K |
| GPT-4.1 | Flagship | $2.00 | $8.00 | 1.0M |
| GPT-4.1 Mini | Mid-tier | $0.400 | $1.60 | 1.0M |
| GPT-4.1 Nano | Lite | $0.100 | $0.400 | 1.0M |
| o3 | Reasoning | $2.00 | $8.00 | 200K |
| o4-mini | Reasoning | $1.10 | $4.40 | 200K |