Introdução
Recentemente, a DeepSeek lançou a ferramenta de código aberto DeepSeek Harness, apostando em preços baixos e acesso para desenvolvedores. Quase simultaneamente, a SpaceX AI lançou o Grok Bot, apostando em informações em tempo real e execução de agentes. O Claude Code e o Codex, como grandes players estabelecidos no mesmo campo, continuam extremamente competitivos.
A Competição Mudou de Comparar Modelos para Capturar Pontos de Entrada
A competição entre os grandes modelos de IA não é mais apenas sobre rankings. Hoje, a OpenAI e a Anthropic ainda detêm capacidades de ponta, mas também precisam competir por pontos de entrada de desenvolvedores, permissões de ferramentas e tarefas de longo prazo. A DeepSeek foca em preços baixos, contextos longos e compatibilidade de interface, enquanto o Grok combina informações em tempo real, o ecossistema X e funções de agente.
As atualizações recentes da DeepSeek foram intensivas. Em 31 de julho, a documentação oficial da API anunciou o beta público do V4 Flash, e em 13 de agosto, o V4 Pro foi lançado. Ambas as versões fornecem contexto de 1M e se integram à API Responses e ao Codex. O anúncio oficial também afirmou que a API será cobrada de acordo com períodos de pico/fora de pico a partir das 16h, horário de Pequim, em 16 de agosto. Mas, para os desenvolvedores, modelos baratos são apenas o primeiro passo; se eles podem ser integrados de forma estável aos fluxos de trabalho existentes é mais importante.
A xAI de Musk, por outro lado, parece estar expandindo os pontos de entrada do produto. Após lançar o Grok 4.5 em 16 de julho, o Grok entrou sucessivamente nas plataformas web, X e mobile, e também lançou Workflows e BuildMode. Em relação ao modelo mais recente, a mídia online noticiou em 13 de agosto os últimos desenvolvimentos do Grok 4.6, mas, até o momento desta escrita, as avaliações comparáveis publicamente disponíveis ainda são baseadas principalmente no Grok 4.5.
Os Quatro Produtos Não Estão na Mesma Corrida
Como todos sabemos, o Claude Code e o Codex são pioneiros em ferramentas de codificação de IA, mas o Claude Code está mais próximo de um terminal local, enquanto o Codex é mais como um agente que executa tarefas remotamente. O DeepSeek Harness é um chassi de código aberto, exigindo que você combine terminais, sistemas de arquivos, web e subagentes por conta própria. O Grok Bot combina informações em tempo real e execução automatizada.
As estratégias de preços também são bastante reveladoras, dadas as diferentes formas de produto.
Planos individuais do Claude Code: Pro a US$ 20/mês, Max 5x a US$ 100/mês, Max 20x a US$ 200/mês.
ChatGPT Plus custa US$ 20/mês, Pro custa US$ 200/mês.
O Grok Bot causa impacto; ele não está incluído no pacote regular de chat do Grok, nem inclui a API paga da xAI. As informações de acesso público mostram que o Grok Bot está atualmente disponível através do SuperGrok Heavy, Cursor Ultra e Cursor Teams Premium, com preços de referência de US$ 300/mês para indivíduos, e US$ 200/mês ou US$ 120/assento para empresas e equipes; não há nível gratuito. O SuperGrok anteriormente disponível a US$ 30/mês e o SuperGrok Plus a US$ 100/mês são assinaturas regulares de chat do Grok e não se qualificam para o nível de preços do Grok Bot.
Classificações no Ranking de Modelos
No snapshot público de 12 de agosto, as classificações do Arena Agent são:
Claude Opus 5 High – #1 com pontuação líquida de melhoria 12,01
GPT 5.6 Sol xHigh – #4 com 10,80
Grok 4.5 – #15 com 6,00
DeepSeek V4 Flash High – #18 com 3,89
V4 Pro – #27 sem pontuação ainda
Este ranking mede o desempenho de modelo-mais-configuração em tarefas reais e não pode ser tratado diretamente como uma classificação geral dos quatro produtos.
Nos rankings de diálogo aberto do Arena Text:
Claude Opus 5 High – #7 com 1494 pontos
GPT 5.6 Sol xHigh – #18 com 1481 pontos
Grok 4.5 – #34 com 1469 pontos
DeepSeek V4 Pro – #49 com 1458 pontos
No mesmo snapshot do SWE-bench Verified, o Claude Opus 4.8 obteve 88,6%, o DeepSeek V4 Pro 80,6%, o GPT 5.4 80,0% e o Grok 4 75,0%. As pontuações indicam a posição de um modelo em certas tarefas, mas não podem poupar os consumidores de considerar fatores como gerenciamento de permissões, testes e experiência do usuário ao escolher.
Claude Code e Codex: Um On-Premise, Outro na Nuvem
Como o atual líder entre as ferramentas de codificação de IA, a força do Claude Code está na colaboração contínua: ler arquivos, modificar código, executar testes e continuar modificando com base nos resultados. É adequado para desenvolvedores que trabalham por muito tempo em um único repositório, mas o custo é que você precisa gerenciar permissões de terminal, contexto e uso por conta própria.
O Codex coloca as tarefas em um ambiente isolado, adequado para diagnosticar problemas, escrever patches e executar verificações, retornando para revisar os resultados. É mais como um colega remoto; quanto mais clara a divisão de tarefas, mais estável a entrega.
Nenhum dos dois é uma caixa preta que entrega com o apertar de um botão. Configuração online, mudanças de permissão e operações de dados ainda exigem confirmação do desenvolvedor.
DeepSeek Harness: Preço Baixo, mas Você Constrói a Base
O apelo do DeepSeek Harness está no baixo custo, contexto longo e modelos substituíveis. O V4 Pro obteve 80,6% no SWE-bench Verified, mas ficou em 27º no snapshot público do Arena Agent. Essa lacuna mostra que as pontuações offline de correção fixa não são o mesmo que a experiência em tarefas reais. É adequado para usuários altamente personalizáveis que estão dispostos a instalar, configurar e solucionar problemas por conta própria, não para iniciantes ou para aqueles que o tratam como software pronto para uso.
Grok Bot: Não é uma Janela de Chat
De acordo com a descrição oficial do produto, o Grok Bot está atualmente em Early Beta. Ele pode fazer login em ferramentas do usuário e executar tarefas persistentes na nuvem, fornecendo efetivamente um ambiente de desenvolvimento em nuvem. Workflows, Automations e BuildMode já moveram o Grok da busca em tempo real para a execução de aplicativos, mas o escopo das permissões e as ferramentas realmente acessíveis ainda determinam seu limite superior. É também por isso que o preço do Grok Bot é mais alto do que as assinaturas comuns do Grok. SuperGrok Heavy, Cursor Ultra e Cursor Teams Premium são pacotes de acesso de referência, e são completamente diferentes dos planos anteriores de chat e API.
Como Escolher? Depende do Seu Trabalho
Se você escreve código principalmente em um repositório local, o Claude Code é mais conveniente. Se você precisa lidar com um lote de tarefas de forma assíncrona, o Codex é mais adequado. Se você quer construir seu próprio agente com modelos de baixo custo, pode tentar o DeepSeek Harness, mas reserve tempo para configuração e manutenção. Se você precisa acompanhar informações em tempo real e depois entregar tarefas para execução na nuvem, a direção do Grok Bot está mais alinhada.
É difícil escolher um campeão geral entre os quatro. Minha combinação recomendada: Grok para encontrar informações em tempo real, DeepSeek para experimentação de baixo custo, e Claude Code ou Codex para implementação e verificação.
