Voltar à Zona do Desenvolvedor

OpenAI Modelos

Explore todos os 16 modelos de OpenAI com preços detalhados, prós e contras e recomendações para desenvolvedores.

16
Modelos
$0.100
Menor Entrada
1.1M
Contexto Máximo
4
Níveis de Qualidade

Recomendações Rápidas

Melhor Custo-Benefício: GPT-4.1 Nano ($0.100/1M)
Melhor Qualidade: GPT-5.6 Sol
Melhor para Raciocínio: GPT-5.5 Pro

GPT-5.6 Sol

NOVOFlagship

Agentic coding, complex workloads

Preços Oficiais

Quando usar: Best for frontier agentic coding, deep research and mission-critical workloads where accuracy matters most.

Destaques da Atualização

  • GPT-5.6 flagship tier — released July 9, 2026
  • Price held at $5/$30 while Terra and Luna were cut on July 30
  • 1.05M context, 128K max output, cache reads at $0.50/M (90% off)
Preço de Entrada
$5.00
per 1M tokens
Preço de Saída
$30.00
per 1M tokens
Entrada em Cache
$0.500
per 1M tokens
Entrada em Lote
$2.50
per 1M tokens
Janela de Contexto: 1.1M
Saída Máxima: 128,000 tokens
Corte de Conhecimento: 2026-01
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Flagship tier of the GPT-5.6 family (launched Jul 9, 2026)
  • 1.05M shared context window with 128K max output
  • Fast mode available at 2x base price
  • Explicit cache breakpoints with 30-min minimum cache life

Contras

  • Output still costs $30/M tokens
  • No fine-tuning support yet

Desempenho

Velocidade de saída~90 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

GPT-5.6 Terra

NOVOMid-tier

Balanced performance & cost

Preços Oficiais

Quando usar: The default choice for production apps, agents and high-value everyday workloads.

Destaques da Atualização

  • Price cut 20% on July 30, 2026: $2.50 → $2 input, $15 → $12 output
  • Cache reads at $0.20/M (90% off input)
  • 1.05M context, 128K max output — same window as Sol
Preço de Entrada
$2.00
per 1M tokens
Preço de Saída
$12.00
per 1M tokens
Entrada em Cache
$0.200
per 1M tokens
Entrada em Lote
$1.00
per 1M tokens
Janela de Contexto: 1.1M
Saída Máxima: 128,000 tokens
Corte de Conhecimento: 2026-01
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Everyday default tier of GPT-5.6
  • 20% price cut on Jul 30, 2026 ($2.50/$15 → $2/$12)
  • Same 1.05M context as Sol at less than half the price

Contras

  • Below Sol-level accuracy on the hardest tasks
  • No Fast mode

Desempenho

Velocidade de saída~100 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

GPT-5.6 Luna

NOVOLite

High-volume, low-latency tasks

Preços Oficiais

Quando usar: Ideal for chatbots, classification, extraction, batch jobs and any high-volume latency-sensitive workload.

Destaques da Atualização

  • Price slashed 80% on July 30, 2026: $1 → $0.20 input, $6 → $1.20 output
  • Cache reads at $0.02/M — among the cheapest frontier-family caches
  • ~1/25 of Sol list price for high-volume work
Preço de Entrada
$0.200
per 1M tokens
Preço de Saída
$1.20
per 1M tokens
Entrada em Cache
$0.020
per 1M tokens
Entrada em Lote
$0.100
per 1M tokens
Janela de Contexto: 1.1M
Saída Máxima: 128,000 tokens
Corte de Conhecimento: 2026-01
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Fastest and most affordable GPT-5.6 tier
  • 80% price cut on Jul 30, 2026 ($1/$6 → $0.20/$1.20)
  • Full 1.05M context at budget price

Contras

  • Lowest capability tier of the family
  • Not suited for deep reasoning tasks

Desempenho

Velocidade de saída~160 tok/s
Limite de taxa10,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

GPT-5.5

Flagship

Codificação agêntica, cargas de trabalho complexas

Preços Oficiais

Quando usar: Melhor para agentes de codificação complexos, uso em computador e cargas de trabalho profissionais onde a precisão é mais importante.

Destaques da Atualização

  • SWE-bench Verificado: 82,7% (+6,5pp vs 76,2% do GPT-5.4)
  • Terminal-Bench: 82,7% — novo SOTA para codificação agêntica
  • Janela de contexto de 1M mantida, 33% menos tokens que o GPT-5.4 na mesma latência
  • Raciocínio científico GeneBench: 28,5% (+3,2pp sobre GPT-5.4)
  • Preço: $5/$30 — 2x GPT-5.4, mas entrada em cache 90% mais barata a $0,50/M
Preço de Entrada
$5.00
per 1M tokens
Preço de Saída
$30.00
per 1M tokens
Entrada em Cache
$0.500
per 1M tokens
Entrada em Lote
$2.50
per 1M tokens
Janela de Contexto: 1M
Saída Máxima: 128,000 tokens
Corte de Conhecimento: 2025-06
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Codificação agêntica de última geração (82,7% Terminal-Bench)
  • Janela de contexto de 1 milhão de tokens
  • Iguala a latência do GPT-5.4 com menos tokens
  • Forte capacidade de pesquisa científica

Contras

  • 2x mais caro que o GPT-5.4
  • Ainda sem suporte para fine-tuning
  • Custo de saída: $30/M tokens

Desempenho

Velocidade de saída~85 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
90.0%
SWE-bench Verified
82.7%
Terminal-Bench
82.7%
GeneBench
28.5%

GPT-5.5 Pro

Reasoning

Precisão premium, computação paralela

Preços Oficiais

Quando usar: Use quando precisar de máxima precisão para análises jurídicas, médicas ou científicas e o custo for secundário.

Destaques da Atualização

  • Computação paralela em tempo de teste: executa múltiplos caminhos de raciocínio, escolhe o melhor
  • GeneBench (raciocínio científico): 33,2% — o maior já registrado
  • Alocação dedicada de GPU para assinantes Pro/Business/Enterprise
  • Mesmo contexto de 1M + saída de 128K que o GPT-5.5 base, mas com raciocínio mais profundo
  • Prêmio de preço de 6x ($30/$180) — justificado apenas para análises críticas
Preço de Entrada
$30.00
per 1M tokens
Preço de Saída
$180.00
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 1M
Saída Máxima: 128,000 tokens
Corte de Conhecimento: 2025-06
VisãoChamada de FunçãoAjuste FinoModo JSON

Prós

  • Maior precisão via computação paralela em tempo de teste
  • 33,2% no GeneBench (raciocínio científico)
  • Alocação dedicada de GPU para assinantes Pro

Contras

  • 6x mais caro que o GPT-5.5 base
  • Sem suporte para API em lote
  • Apenas para níveis Pro/Business/Enterprise

Desempenho

Velocidade de saída~40 tok/s
Limite de taxa3,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
90.5%
GeneBench
33.2%
SWE-bench Verified
79.0%

GPT-5.5 Turbo

Mid-tier

Aplicativos de alto volume, chatbots, inferência rápida

Preços Oficiais

Quando usar: Melhor para aplicativos de produção de alto volume que precisam da qualidade GPT-5.5 a custo menor — chatbots, resumos, classificação.

Destaques da Atualização

  • Qualidade de classe GPT-5.5 com custo de saída ~33% menor ($20 vs $30/M)
  • Janela de contexto de 200K — suficiente para a maioria dos casos de uso em produção
  • Inferência rápida: 1,5x mais rápida que GPT-5.5 para aplicações em tempo real
  • Mesmo máximo de saída de 128K que GPT-5.5 base
  • Camada gratuita disponível — melhor valor para implantações de alto volume
Preço de Entrada
$5.00
per 1M tokens
Preço de Saída
$20.00
per 1M tokens
Entrada em Cache
$0.500
per 1M tokens
Entrada em Lote
$2.50
per 1M tokens
Janela de Contexto: 200K
Saída Máxima: 128,000 tokens
Corte de Conhecimento: 2025-06
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Inteligência de classe GPT-5.5 a custo menor
  • Janela de contexto de 200K
  • Saída 33% mais barata que GPT-5.5
  • Inferência rápida para aplicativos em tempo real

Contras

  • Contexto menor em comparação com GPT-5.5 (200K vs 1M)
  • Sem suporte para ajuste fino
  • Precisão de raciocínio ligeiramente inferior

Desempenho

Velocidade de saída~120 tok/s
Limite de taxa10,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
88.5%
SWE-bench Verified
80.0%
HumanEval
90.0%

GPT-5.4

Flagship

Codificação, uso de computador, trabalho de conhecimento

Preços Oficiais

Quando usar: Excelente versátil para assistentes de codificação, automação de desktop e trabalho de conhecimento empresarial.

Destaques da Atualização

  • OSWorld: 75% — primeira IA a superar a automação de desktop em nível humano
  • 33% menos erros factuais vs GPT-5.2 (redução de alucinação)
  • Tool Search: descobre ferramentas dinamicamente, reduz o uso de tokens do agente em ~40%
  • Contexto: 128K → 1M tokens (aumento de 8x em relação ao GPT-4o)
  • Saída máxima: 16K → 128K tokens (aumento de 8x), preço $2.50/$15
Preço de Entrada
$2.50
per 1M tokens
Preço de Saída
$15.00
per 1M tokens
Entrada em Cache
$0.250
per 1M tokens
Entrada em Lote
$1.25
per 1M tokens
Janela de Contexto: 1M
Saída Máxima: 128,000 tokens
Corte de Conhecimento: 2025-03
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Primeira IA a superar o desempenho humano em desktop (75% OSWorld)
  • Codificação unificada + uso de computador + trabalho de conhecimento
  • 33% menos erros factuais que o GPT-5.2
  • Tool Search reduz o uso de tokens para agentes

Contras

  • Mais caro que o GPT-4.1
  • Ainda sem ajuste fino
  • Preço de entrada dobra acima de 272K de contexto

Desempenho

Velocidade de saída~90 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
89.5%
SWE-bench Verified
76.2%
OSWorld
75.0%
IFEval
87.0%

GPT-5.4 Mini

Mid-tier

Codificação econômica e tarefas de desenvolvimento

Preços Oficiais

Quando usar: Melhor custo-benefício para tarefas de codificação de alto volume, chatbots e cargas de trabalho de desenvolvimento mais leves.

Destaques da Atualização

  • SWE-bench Pro: 54,38% — apenas 3,3 pp abaixo dos 57,7% do GPT-5.4 Standard
  • 6x mais barato que o GPT-5.4 Standard ($0,75 vs $5/M de entrada)
  • Janela de contexto de 400K — suficiente para a maioria das tarefas de codificação
  • Mesmo máximo de saída de 128K que o principal, 90% de economia em entrada em cache
  • Lançado 12 dias após o Standard — a variante mini mais rápida de sempre
Preço de Entrada
$0.750
per 1M tokens
Preço de Saída
$4.50
per 1M tokens
Entrada em Cache
$0.075
per 1M tokens
Entrada em Lote
$0.375
per 1M tokens
Janela de Contexto: 400K
Saída Máxima: 128,000 tokens
Corte de Conhecimento: 2025-03
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • 54,38% SWE-bench Pro (próximo dos 57,7% do Standard)
  • 6x mais barato que o GPT-5.4 Standard
  • Janela de contexto de 400K
  • Acesso gratuito disponível

Contras

  • Qualidade de raciocínio inferior ao Standard
  • Janela de contexto menor que o total de 1M
  • Lançado 12 dias após o Standard

Desempenho

Velocidade de saída~120 tok/s
Limite de taxa10,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

SWE-bench Pro
54.38%
MMLU
86.0%
HumanEval
88.2%

GPT-5.4 Nano

Lite

Edge, embarcado, mobile

Preços Oficiais

Quando usar: Ideal para assistentes em dispositivos, aplicativos móveis e cenários onde a latência de rede é uma preocupação.

Destaques da Atualização

  • Projetado para edge/mobile/IoT — otimizado para inferência no dispositivo
  • Saída máxima de 128K com contexto de 272K — maior relação saída/contexto
  • Visão + chamada de funções por $0,20/M de entrada — antes exclusivo de modelos flagship
  • Latência otimizada para interações móveis em tempo real
  • Contexto de 272K vs 1M para Standard — trade-off entre velocidade e custo
Preço de Entrada
$0.200
per 1M tokens
Preço de Saída
$1.25
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 272K
Saída Máxima: 128,000 tokens
Corte de Conhecimento: 2025-03
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Custo ultrabaixo para implantações edge
  • Projetado para dispositivos móveis e IoT
  • Saída máxima de 128K apesar do tamanho reduzido

Contras

  • Benchmarks limitados disponíveis
  • Janela de contexto menor
  • Lacuna de qualidade para tarefas complexas

Desempenho

Velocidade de saída~150 tok/s
Limite de taxa15,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
78.5%
HumanEval
76.0%

GPT-4o

Flagship

Propósito geral, multimodal

Preços Oficiais

Quando usar: Melhor escolha padrão para a maioria dos aplicativos que exigem saída multimodal de alta qualidade.

Destaques da Atualização

  • Primeiro modelo nativamente multimodal: texto + imagem + áudio em um único modelo
  • 2x mais rápido que GPT-4 Turbo com 50% menos custo ($2,50 vs $5/M de entrada)
  • Compreensão nativa de áudio — sem necessidade de pipeline separado do Whisper
  • Suporte a fine-tuning para adaptação de domínio (exclusivo do modelo principal)
  • Contexto de 128K — substituído pelo 1M do GPT-4.1 para tarefas de documentos longos
Preço de Entrada
$2.50
per 1M tokens
Preço de Saída
$10.00
per 1M tokens
Entrada em Cache
$1.25
per 1M tokens
Entrada em Lote
$1.25
per 1M tokens
Janela de Contexto: 128K
Saída Máxima: 16,384 tokens
Corte de Conhecimento: 2023-10
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Multimodal (texto + imagem + áudio)
  • Qualidade excelente para uso geral
  • Chamada de função forte e modo JSON

Contras

  • Custo mais alto que variantes mini/nano
  • Contexto de 128K vs 1M+ para modelos 4.1 mais recentes

Desempenho

Velocidade de saída~75 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
88.7%
HumanEval
90.2%
MATH
76.6%
IFEval
80.4%

Agentes que usam este modelo

3

GPT-4o Mini

Lite

Tarefas rápidas e econômicas

Preços Oficiais

Quando usar: Ótimo para cargas de trabalho de alto volume e sensíveis a custos, como chatbots e sumarização.

Destaques da Atualização

  • Substituiu o GPT-3.5 Turbo: 46% mais barato, qualidade significativamente melhor
  • Mesmo contexto de 128K que o GPT-4o por 1/17 do preço
  • Pontuação de 82% no MMLU — aproximando-se do nível GPT-4 em tarefas de conhecimento
  • Visão + chamada de funções por US$ 0,15/M — recursos anteriormente exclusivos do carro-chefe
  • Ajuste fino disponível — melhor relação custo/qualidade para modelos ajustados
Preço de Entrada
$0.150
per 1M tokens
Preço de Saída
$0.600
per 1M tokens
Entrada em Cache
$0.075
per 1M tokens
Entrada em Lote
$0.075
per 1M tokens
Janela de Contexto: 128K
Saída Máxima: 16,384 tokens
Corte de Conhecimento: 2023-10
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Extremamente acessível
  • Mesmo contexto de 128K que o GPT-4o
  • Suporta visão + chamada de funções

Contras

  • Qualidade de raciocínio inferior à do carro-chefe
  • Não é ideal para tarefas complexas de várias etapas

Desempenho

Velocidade de saída~130 tok/s
Limite de taxa10,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
82.0%
HumanEval
87.2%
MATH
67.5%

GPT-4.1

Flagship

Codificação, seguimento de instruções

Preços Oficiais

Quando usar: Melhor escolha para assistentes de codificação e análise de documentos longos.

Destaques da Atualização

  • Contexto: 128K → 1M tokens (salto de 8x em relação ao GPT-4o)
  • SWE-bench Verificado: 54,6% — melhor pontuação de codificação no lançamento
  • Saída máxima: 32K tokens (2x os 16K do GPT-4o)
  • Seguimento de instruções: 40% melhor no IFEval em comparação com GPT-4o
  • Mais barato que GPT-4o ($2 vs $2,50/M entrada) com mais capacidade
Preço de Entrada
$2.00
per 1M tokens
Preço de Saída
$8.00
per 1M tokens
Entrada em Cache
$0.500
per 1M tokens
Entrada em Lote
$1.00
per 1M tokens
Janela de Contexto: 1.0M
Saída Máxima: 32,768 tokens
Corte de Conhecimento: 2024-04
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Janela de contexto de 1 milhão de tokens
  • Melhor capacidade de codificação da categoria
  • Mais barato que GPT-4o com melhor contexto

Contras

  • Mais lento que mini/nano para tarefas simples
  • Modelo mais novo, menos testado

Desempenho

Velocidade de saída~70 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
88.3%
SWE-bench Verified
54.6%
IFEval
84.0%
HumanEval
92.0%

GPT-4.1 Mini

Mid-tier

Desempenho equilibrado e custo

Preços Oficiais

Quando usar: Ponto ideal para aplicações de produção que precisam de contexto longo sem custos de carro-chefe.

Destaques da Atualização

  • Contexto de 1M a $0,40/M de entrada — 5x mais barato que o carro-chefe GPT-4.1
  • Mesmo contexto de 1M + saída de 32K que o carro-chefe para uso em produção
  • Suporte multimodal completo (visão, chamada de função, ajuste fino)
  • SWE-bench: 42,8% — codificação forte a preço intermediário
  • Substituiu o GPT-4o Mini para cargas de trabalho de produção de contexto longo
Preço de Entrada
$0.400
per 1M tokens
Preço de Saída
$1.60
per 1M tokens
Entrada em Cache
$0.100
per 1M tokens
Entrada em Lote
$0.200
per 1M tokens
Janela de Contexto: 1.0M
Saída Máxima: 32,768 tokens
Corte de Conhecimento: 2024-04
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Contexto de 1M a preço intermediário
  • Codificação forte pelo preço
  • Suporte multimodal completo

Contras

  • Diferença de qualidade em relação ao carro-chefe para raciocínio complexo
  • Ainda mais caro que o nano

Desempenho

Velocidade de saída~110 tok/s
Limite de taxa10,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
84.5%
SWE-bench Verified
42.8%
HumanEval
86.5%

GPT-4.1 Nano

Lite

Dispositivos de borda com latência ultrabaixa

Preços Oficiais

Quando usar: Ideal para classificação em tempo real, extração e pipelines de alto rendimento.

Destaques da Atualização

  • Modelo mais barato com contexto de 1M: $0,10/M de entrada (GPT-3.5 Turbo era $0,50)
  • Conjunto completo de recursos no nível leve: visão + chamada de função + ajuste fino
  • Contexto: 128K → 1M (aumento de 8x em relação aos 128K do GPT-4o Mini)
  • Tempos de resposta mais rápidos da linha OpenAI — latência típica abaixo de 200ms
  • Entrada em cache a $0,025/M — economia de 97,5% para prefixos repetidos
Preço de Entrada
$0.100
per 1M tokens
Preço de Saída
$0.400
per 1M tokens
Entrada em Cache
$0.025
per 1M tokens
Entrada em Lote
$0.050
per 1M tokens
Janela de Contexto: 1.0M
Saída Máxima: 32,768 tokens
Corte de Conhecimento: 2024-04
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Modelo OpenAI mais barato com contexto de 1M
  • Tempos de resposta mais rápidos
  • Conjunto completo de recursos (visão, FC, ajuste fino)

Contras

  • Queda perceptível de qualidade para tarefas complexas
  • Não adequado para raciocínio profundo

Desempenho

Velocidade de saída~160 tok/s
Limite de taxa15,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
76.0%
HumanEval
72.8%

o3

Reasoning

Raciocínio complexo, matemática, ciência

Preços Oficiais

Quando usar: Use para problemas que exigem raciocínio passo a passo, provas matemáticas e análise científica.

Destaques da Atualização

  • ARC-AGI: 87,5% — quase humano em tarefas abstratas de raciocínio
  • Saída máxima: 100K tokens (4x os 25K do o1) para cadeia de pensamento profunda
  • Visão + chamada de função — novas capacidades em comparação ao o1 apenas texto
  • Olimpíada de Matemática: Nível de medalha de ouro no AIME 2024 (93,3%)
  • Preço: $2/$8 — 1/3 do custo do o1 Pro a $200/M
Preço de Entrada
$2.00
per 1M tokens
Preço de Saída
$8.00
per 1M tokens
Entrada em Cache
$0.500
per 1M tokens
Entrada em Lote
$1.00
per 1M tokens
Janela de Contexto: 200K
Saída Máxima: 100,000 tokens
Corte de Conhecimento: 2024-05
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Capacidade de raciocínio de ponta
  • Saída máxima de 100K para cadeia de pensamento longa
  • Excelente em matemática e ciência

Contras

  • Mais lento devido ao tempo de pensamento
  • Sem suporte para ajuste fino
  • Custo mais alto para tokens de raciocínio

Desempenho

Velocidade de saída~25 tok/s
Limite de taxa3,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

ARC-AGI
87.5%
AIME 2024
93.3%
MATH
96.7%
GPQA
83.3%

Agentes que usam este modelo

1

o4-mini

Reasoning

Raciocínio a menor custo

Preços Oficiais

Quando usar: Melhor valor para cargas de trabalho de raciocínio — ótimo para produção onde o3 é exagerado.

Destaques da Atualização

  • 55% mais barato que o3 ($1,10 vs $2/M de entrada) para tarefas de raciocínio
  • Mesmo máximo de 100K de saída que o3 — sem compromisso na profundidade do raciocínio
  • Inferência mais rápida que o3 com orçamento de pensamento otimizado
  • Visão + chamada de função no nível de raciocínio — anteriormente exclusivo do o3
  • Entrada em cache: $0,275/M — 75% de economia para prompts repetidos
Preço de Entrada
$1.10
per 1M tokens
Preço de Saída
$4.40
per 1M tokens
Entrada em Cache
$0.275
per 1M tokens
Entrada em Lote
$0.550
per 1M tokens
Janela de Contexto: 200K
Saída Máxima: 100,000 tokens
Corte de Conhecimento: 2024-05
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • 55% mais barato que o3 para raciocínio
  • Mesmo máximo de 100K de saída
  • Mais rápido que o3

Contras

  • Menos capaz que o3 nos problemas mais difíceis
  • Sem ajuste fino
  • Tokens de raciocínio adicionam custo oculto

Desempenho

Velocidade de saída~35 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

AIME 2024
90.0%
MATH
92.5%
GPQA
78.1%

Agentes que usam este modelo

1

Comparação Lado a Lado

ModeloNívelEntradaSaídaContexto
GPT-5.6 SolFlagship$5.00$30.001.1M
GPT-5.6 TerraMid-tier$2.00$12.001.1M
GPT-5.6 LunaLite$0.200$1.201.1M
GPT-5.5Flagship$5.00$30.001M
GPT-5.5 ProReasoning$30.00$180.001M
GPT-5.5 TurboMid-tier$5.00$20.00200K
GPT-5.4Flagship$2.50$15.001M
GPT-5.4 MiniMid-tier$0.750$4.50400K
GPT-5.4 NanoLite$0.200$1.25272K
GPT-4oFlagship$2.50$10.00128K
GPT-4o MiniLite$0.150$0.600128K
GPT-4.1Flagship$2.00$8.001.0M
GPT-4.1 MiniMid-tier$0.400$1.601.0M
GPT-4.1 NanoLite$0.100$0.4001.0M
o3Reasoning$2.00$8.00200K
o4-miniReasoning$1.10$4.40200K