Einleitung
Kürzlich hat DeepSeek das Open-Source-Tool DeepSeek Harness veröffentlicht und setzt dabei auf niedrige Preise und Entwicklerzugang. Fast zeitgleich hat SpaceX AI Grok Bot veröffentlicht und setzt auf Echtzeitinformationen und Agentenausführung. Claude Code und Codex, als etablierte starke Akteure im selben Bereich, bleiben weiterhin hart umkämpft.
Der Wettbewerb hat sich vom Vergleich der Modelle zur Eroberung von Einstiegspunkten verlagert
Der Wettbewerb zwischen großen KI-Modellen dreht sich nicht mehr nur um Bestenlisten. Heute halten OpenAI und Anthropic immer noch High-End-Fähigkeiten, aber sie müssen auch um Entwickler-Einstiegspunkte, Tool-Berechtigungen und langfristige Aufgaben konkurrieren. DeepSeek konzentriert sich auf niedrige Preise, lange Kontexte und Schnittstellenkompatibilität, während Grok Echtzeitinformationen, das X-Ökosystem und Agentenfunktionen bündelt.
DeepSeeks jüngste Updates waren intensiv. Am 31. Juli kündigte die offizielle API-Dokumentation die öffentliche Beta von V4 Flash an, und am 13. August wurde V4 Pro veröffentlicht. Beide Versionen bieten 1M Kontext und integrieren sich in die Responses API und Codex. Die offizielle Ankündigung besagte auch, dass die API ab 16:00 Uhr Pekinger Zeit am 16. August nach Spitzen-/Nebenzeiten abgerechnet wird. Aber für Entwickler sind billige Modelle nur der erste Schritt; ob sie stabil in bestehende Arbeitsabläufe integriert werden können, ist wichtiger.
Musk's xAI hingegen scheint die Produkt-Einstiegspunkte zu erweitern. Nach der Veröffentlichung von Grok 4.5 am 16. Juli kam Grok nacheinander auf Web-, X- und Mobilplattformen und startete auch Workflows und BuildMode. Bezüglich des neuesten Modells berichteten Online-Medien am 13. August über die neuesten Entwicklungen von Grok 4.6, aber zum Zeitpunkt dieses Schreibens basieren öffentlich verfügbare vergleichbare Bewertungen immer noch hauptsächlich auf Grok 4.5.
Die vier Produkte befinden sich nicht im selben Rennen
Wie wir alle wissen, sind Claude Code und Codex Pioniere bei KI-Codierungstools, aber Claude Code ist näher an einem lokalen Terminal, während Codex eher wie ein Agent ist, der Aufgaben remote ausführt. DeepSeek Harness ist ein Open-Source-Chassis, das Sie selbst mit Terminals, Dateisystemen, Web und Sub-Agenten kombinieren müssen. Grok Bot kombiniert Echtzeitinformationen und automatisierte Ausführung.
Die Preisstrategien sind angesichts ihrer unterschiedlichen Produktformen auch ziemlich aufschlussreich.
Claude Codes Einzelpläne: Pro für 20 $/Monat, Max 5x für 100 $/Monat, Max 20x für 200 $/Monat.
ChatGPT Plus kostet 20 $/Monat, Pro 200 $/Monat.
Grok Bot macht Eindruck; es ist nicht im regulären Grok-Chat-Bundle enthalten und beinhaltet auch keine kostenpflichtige xAI-API. Öffentliche Zugangsinformationen zeigen, dass Grok Bot derzeit über SuperGrok Heavy, Cursor Ultra und Cursor Teams Premium verfügbar ist, mit Referenzpreisen von 300 $/Monat für Einzelpersonen und 200 $/Monat oder 120 $/Sitzplatz für Unternehmen und Teams; es gibt keine kostenlose Stufe. Das zuvor verfügbare SuperGrok für 30 $/Monat und SuperGrok Plus für 100 $/Monat sind reguläre Grok-Chat-Abonnements und qualifizieren sich nicht für die Grok-Bot-Preisstufe.
Modell-Bestenlisten-Rankings
Im öffentlichen Snapshot vom 12. August sind die Arena-Agent-Rankings:
Claude Opus 5 High – #1 mit Netto-Verbesserungswert 12,01
GPT 5.6 Sol xHigh – #4 mit 10,80
Grok 4.5 – #15 mit 6,00
DeepSeek V4 Flash High – #18 mit 3,89
V4 Pro – #27 mit noch keinem Wert
Dieses Ranking misst die Modell-plus-Konfigurationsleistung bei realen Aufgaben und kann nicht direkt als Gesamtrangliste der vier Produkte behandelt werden.
In den Arena-Text-Offene-Dialog-Rankings:
Claude Opus 5 High – #7 mit 1494 Punkten
GPT 5.6 Sol xHigh – #18 mit 1481 Punkten
Grok 4.5 – #34 mit 1469 Punkten
DeepSeek V4 Pro – #49 mit 1458 Punkten
Im selben SWE-bench Verified Snapshot erzielte Claude Opus 4.8 88,6 %, DeepSeek V4 Pro 80,6 %, GPT 5.4 80,0 % und Grok 4 75,0 %. Die Werte zeigen die Position eines Modells bei bestimmten Aufgaben, aber sie können Verbraucher nicht davor bewahren, bei der Auswahl Faktoren wie Berechtigungsverwaltung, Tests und Benutzererfahrung zu berücksichtigen.
Claude Code und Codex: Einer On-Premise, einer in der Cloud
Als aktueller Marktführer unter den KI-Codierungstools liegt die Stärke von Claude Code in der kontinuierlichen Zusammenarbeit: Dateien lesen, Code ändern, Tests ausführen und dann basierend auf den Ergebnissen weiter ändern. Es ist für Entwickler geeignet, die langfristig in einem einzigen Repository arbeiten, aber der Preis ist, dass Sie Terminalberechtigungen, Kontext und Nutzung selbst verwalten müssen.
Codex platziert Aufgaben in einer isolierten Umgebung, geeignet zum Diagnostizieren von Problemen, Schreiben von Patches und Ausführen von Verifizierungen, und kehrt dann zurück, um Ergebnisse zu überprüfen. Es ist eher wie ein Remote-Kollege; je klarer die Aufgabenaufteilung, desto stabiler die Lieferung.
Keines ist eine Blackbox, die auf Knopfdruck liefert. Online-Konfiguration, Berechtigungsänderungen und Datenoperationen erfordern weiterhin die Bestätigung des Entwicklers.
DeepSeek Harness: Niedriger Preis, aber Sie bauen die Basis selbst
Der Reiz von DeepSeek Harness liegt in seinen niedrigen Kosten, dem langen Kontext und den austauschbaren Modellen. V4 Pro erzielte 80,6 % bei SWE-bench Verified, belegte aber im öffentlichen Arena-Agent-Snapshot den 27. Platz. Diese Lücke zeigt, dass Offline-Fix-Reparaturwerte nicht dasselbe sind wie die Erfahrung mit realen Aufgaben. Es ist für hochgradig anpassbare Benutzer geeignet, die bereit sind, selbst zu installieren, zu konfigurieren und Fehler zu beheben, nicht für Anfänger oder diejenigen, die es als sofort einsatzbereite Software behandeln.
Grok Bot: Kein Chat-Fenster
Laut der offiziellen Produktbeschreibung befindet sich Grok Bot derzeit in der Early Beta. Es kann sich bei Benutzertools anmelden und persistente Aufgaben in der Cloud ausführen, was effektiv eine Cloud-Entwicklungsumgebung bereitstellt. Workflows, Automations und BuildMode haben Grok bereits von der Echtzeitsuche zur Anwendungsausführung bewegt, aber der Umfang der Berechtigungen und die tatsächlich zugänglichen Tools bestimmen immer noch seine Obergrenze. Dies ist auch der Grund, warum der Preis von Grok Bot höher ist als bei gewöhnlichen Grok-Abonnements. SuperGrok Heavy, Cursor Ultra und Cursor Teams Premium sind Referenz-Zugangs-Bundles und völlig verschieden von früheren Chat- und API-Plänen.
Wie wählen? Es hängt von Ihrer Arbeit ab
Wenn Sie hauptsächlich Code in einem lokalen Repository schreiben, ist Claude Code bequemer. Wenn Sie eine Reihe von Aufgaben asynchron erledigen müssen, ist Codex besser geeignet. Wenn Sie Ihren eigenen Agenten mit kostengünstigen Modellen bauen möchten, können Sie DeepSeek Harness ausprobieren, aber planen Sie Zeit für Konfiguration und Wartung ein. Wenn Sie Echtzeitinformationen verfolgen und dann Aufgaben zur Ausführung an die Cloud übergeben müssen, ist die Richtung von Grok Bot besser geeignet.
Es ist schwer, einen Gesamtsieger unter den vieren zu küren. Meine empfohlene Kombination: Grok zum Finden von Echtzeitinformationen, DeepSeek für kostengünstige Experimente und Claude Code oder Codex für Implementierung und Verifizierung.
