Introduction
Récemment, DeepSeek a publié l'outil open source DeepSeek Harness, misant sur des prix bas et l'accès aux développeurs. Presque simultanément, SpaceX AI a publié Grok Bot, misant sur les informations en temps réel et l'exécution d'agents. Claude Code et Codex, en tant qu'acteurs majeurs établis dans le même domaine, restent farouchement compétitifs.
La concurrence est passée de la comparaison des modèles à la capture des points d'entrée
La concurrence entre les grands modèles d'IA ne se limite plus aux classements. Aujourd'hui, OpenAI et Anthropic détiennent toujours des capacités haut de gamme, mais ils doivent aussi rivaliser pour les points d'entrée des développeurs, les autorisations d'outils et les tâches à long terme. DeepSeek se concentre sur les prix bas, les contextes longs et la compatibilité des interfaces, tandis que Grok regroupe les informations en temps réel, l'écosystème X et les fonctions d'agent.
Les mises à jour récentes de DeepSeek ont été intensives. Le 31 juillet, la documentation officielle de l'API a annoncé la version bêta publique de V4 Flash, et le 13 août, V4 Pro a été publié. Les deux versions fournissent un contexte de 1M et s'intègrent à l'API Responses et à Codex. L'annonce officielle a également indiqué que l'API serait facturée selon les périodes de pointe/hors pointe à partir de 16h00, heure de Pékin, le 16 août. Mais pour les développeurs, les modèles bon marché ne sont que la première étape ; la possibilité de les intégrer de manière stable dans les flux de travail existants est plus importante.
xAI de Musk, quant à lui, semble élargir les points d'entrée des produits. Après la publication de Grok 4.5 le 16 juillet, Grok est successivement entré sur les plateformes web, X et mobiles, et a également lancé Workflows et BuildMode. Concernant le dernier modèle, les médias en ligne ont rapporté le 13 août les derniers développements de Grok 4.6, mais au moment de la rédaction, les évaluations comparables publiquement disponibles sont encore principalement basées sur Grok 4.5.
Les quatre produits ne sont pas dans la même course
Comme nous le savons tous, Claude Code et Codex sont des pionniers des outils de codage IA, mais Claude Code est plus proche d'un terminal local, tandis que Codex ressemble davantage à un agent qui exécute des tâches à distance. DeepSeek Harness est un châssis open source, nécessitant que vous combiniez vous-même terminaux, système de fichiers, web et sous-agents. Grok Bot combine informations en temps réel et exécution automatisée.
Les stratégies de tarification sont également très révélatrices compte tenu de leurs différentes formes de produits.
Plans individuels de Claude Code : Pro à 20 $/mois, Max 5x à 100 $/mois, Max 20x à 200 $/mois.
ChatGPT Plus est à 20 $/mois, Pro à 200 $/mois.
Grok Bot fait sensation ; il n'est pas inclus dans le bundle de chat Grok régulier, ni ne comprend l'API xAI payante. Les informations d'accès public montrent que Grok Bot est actuellement disponible via SuperGrok Heavy, Cursor Ultra et Cursor Teams Premium, avec des prix de référence de 300 $/mois pour les particuliers, et de 200 $/mois ou 120 $/siège pour les entreprises et les équipes ; il n'y a pas de niveau gratuit. Les SuperGrok à 30 $/mois et SuperGrok Plus à 100 $/mois précédemment disponibles sont des abonnements de chat Grok réguliers et ne sont pas éligibles au niveau de tarification de Grok Bot.
Classements des modèles
Dans l'instantané public au 12 août, les classements Arena Agent sont :
Claude Opus 5 High – #1 avec un score d'amélioration net de 12,01
GPT 5.6 Sol xHigh – #4 avec 10,80
Grok 4.5 – #15 avec 6,00
DeepSeek V4 Flash High – #18 avec 3,89
V4 Pro – #27 sans score pour l'instant
Ce classement mesure les performances modèle-plus-configuration sur des tâches réelles et ne peut pas être directement traité comme un classement global des quatre produits.
Dans les classements de dialogue ouvert Arena Text :
Claude Opus 5 High – #7 avec 1494 points
GPT 5.6 Sol xHigh – #18 avec 1481 points
Grok 4.5 – #34 avec 1469 points
DeepSeek V4 Pro – #49 avec 1458 points
Dans le même instantané SWE-bench Verified, Claude Opus 4.8 a obtenu 88,6 %, DeepSeek V4 Pro 80,6 %, GPT 5.4 80,0 % et Grok 4 75,0 %. Les scores indiquent la position d'un modèle dans certaines tâches, mais ils ne peuvent pas empêcher les consommateurs de prendre en compte des facteurs tels que la gestion des autorisations, les tests et l'expérience utilisateur lors du choix.
Claude Code et Codex : l'un sur site, l'autre dans le cloud
En tant que leader actuel des outils de codage IA, la force de Claude Code réside dans la collaboration continue : lire des fichiers, modifier du code, exécuter des tests, puis continuer à modifier en fonction des résultats. Il convient aux développeurs qui travaillent à long terme dans un seul dépôt, mais le coût est que vous devez gérer vous-même les autorisations du terminal, le contexte et l'utilisation.
Codex place les tâches dans un environnement isolé, adapté au diagnostic des problèmes, à l'écriture de correctifs et à l'exécution de vérifications, puis au retour pour vérifier les résultats. Il ressemble davantage à un collègue distant ; plus la répartition des tâches est claire, plus la livraison est stable.
Aucun des deux n'est une boîte noire qui livre en appuyant sur un bouton. La configuration en ligne, les changements d'autorisations et les opérations de données nécessitent toujours la confirmation du développeur.
DeepSeek Harness : prix bas, mais vous construisez la base vous-même
L'attrait de DeepSeek Harness réside dans son faible coût, son contexte long et ses modèles remplaçables. V4 Pro a obtenu 80,6 % sur SWE-bench Verified, mais s'est classé 27e dans l'instantané public Arena Agent. Cet écart montre que les scores de réparation fixe hors ligne ne sont pas les mêmes que l'expérience de tâche réelle. Il convient aux utilisateurs hautement personnalisables qui sont prêts à installer, configurer et dépanner eux-mêmes, pas aux débutants ni à ceux qui le traitent comme un logiciel prêt à l'emploi.
Grok Bot : pas une fenêtre de chat
Selon la description officielle du produit, Grok Bot est actuellement en Early Beta. Il peut se connecter aux outils de l'utilisateur et exécuter des tâches persistantes dans le cloud, fournissant efficacement un environnement de développement cloud. Workflows, Automations et BuildMode ont déjà déplacé Grok de la recherche en temps réel vers l'exécution d'applications, mais la portée des autorisations et les outils réellement accessibles déterminent toujours sa limite supérieure. C'est aussi pourquoi le prix de Grok Bot est plus élevé que les abonnements Grok ordinaires. SuperGrok Heavy, Cursor Ultra et Cursor Teams Premium sont des bundles d'accès de référence, et ils sont complètement différents des plans de chat et d'API précédents.
Comment choisir ? Cela dépend de votre travail
Si vous écrivez principalement du code dans un dépôt local, Claude Code est plus pratique. Si vous devez gérer de manière asynchrone un lot de tâches, Codex est plus adapté. Si vous voulez construire votre propre agent avec des modèles à faible coût, vous pouvez essayer DeepSeek Harness, mais prévoyez du temps pour la configuration et la maintenance. Si vous devez suivre des informations en temps réel puis confier des tâches au cloud pour exécution, la direction de Grok Bot est plus alignée.
Il est difficile de désigner un champion global parmi les quatre. Ma combinaison recommandée : Grok pour trouver des informations en temps réel, DeepSeek pour l'expérimentation à faible coût, et Claude Code ou Codex pour l'implémentation et la vérification.
