Введение
Недавно DeepSeek выпустил инструмент с открытым исходным кодом DeepSeek Harness, сделав ставку на низкие цены и доступ для разработчиков. Почти одновременно SpaceX AI выпустила Grok Bot, сделав ставку на информацию в реальном времени и выполнение задач агентами. Claude Code и Codex, как признанные сильные игроки в той же области, остаются в условиях жесткой конкуренции.
Конкуренция сместилась со сравнения моделей на захват точек входа
Конкуренция среди больших языковых моделей больше не сводится только к рейтингам. Сегодня OpenAI и Anthropic по-прежнему обладают высококлассными возможностями, но им также приходится бороться за точки входа для разработчиков, разрешения на использование инструментов и долгосрочные задачи. DeepSeek делает акцент на низких ценах, длинном контексте и совместимости интерфейсов, в то время как Grok объединяет информацию в реальном времени, экосистему X и функции агентов.
Последние обновления DeepSeek были интенсивными. 31 июля в официальной документации API было объявлено о публичной бета-версии V4 Flash, а 13 августа была выпущена V4 Pro. Обе версии предоставляют контекст в 1 млн токенов и интегрированы с Responses API и Codex. В официальном объявлении также говорилось, что API будет тарифицироваться по пиковым/непиковым периодам, начиная с 16:00 по пекинскому времени 16 августа. Но для разработчиков дешевые модели — это лишь первый шаг; важнее то, смогут ли они быть стабильно интегрированы в существующие рабочие процессы.
xAI Маска, с другой стороны, похоже, расширяет точки входа для продуктов. После выпуска Grok 4.5 16 июля Grok последовательно появился на веб-платформах, X и мобильных устройствах, а также запустил Workflows и BuildMode. Что касается последней модели, онлайн-СМИ 13 августа сообщили о последних разработках Grok 4.6, но на момент написания этой статьи публично доступные сопоставимые оценки по-прежнему в основном основаны на Grok 4.5.
Четыре продукта не участвуют в одной гонке
Как известно, Claude Code и Codex являются пионерами в области ИИ-инструментов для программирования, но Claude Code ближе к локальному терминалу, в то время как Codex больше похож на агента, который выполняет задачи удаленно. DeepSeek Harness — это шасси с открытым исходным кодом, требующее самостоятельного объединения терминалов, файловой системы, веб-интерфейса и субагентов. Grok Bot сочетает информацию в реальном времени и автоматизированное выполнение.
Стратегии ценообразования также весьма показательны, учитывая различные формы продуктов.
Индивидуальные планы Claude Code: Pro за $20/месяц, Max 5x за $100/месяц, Max 20x за $200/месяц.
ChatGPT Plus стоит $20/месяц, Pro — $200/месяц.
Grok Bot производит фурор; он не включен в обычный пакет чата Grok и не включает платный xAI API. Публичная информация о доступе показывает, что Grok Bot в настоящее время доступен через SuperGrok Heavy, Cursor Ultra и Cursor Teams Premium, с ориентировочными ценами $300/месяц для частных лиц и $200/месяц или $120 за место для предприятий и команд; бесплатного тарифа нет. Ранее доступные SuperGrok за $30/месяц и SuperGrok Plus за $100/месяц являются обычными подписками на чат Grok и не соответствуют ценовому уровню Grok Bot.
Рейтинги моделей
В публичном снимке по состоянию на 12 августа рейтинги Arena Agent следующие:
Claude Opus 5 High — #1 с чистым показателем улучшения 12.01
GPT 5.6 Sol xHigh — #4 с 10.80
Grok 4.5 — #15 с 6.00
DeepSeek V4 Flash High — #18 с 3.89
V4 Pro — #27, пока без оценки
Этот рейтинг измеряет производительность модели плюс конфигурацию на реальных задачах и не может напрямую рассматриваться как общий рейтинг четырех продуктов.
В рейтингах открытых диалогов Arena Text:
Claude Opus 5 High — #7 с 1494 очками
GPT 5.6 Sol xHigh — #18 с 1481 очком
Grok 4.5 — #34 с 1469 очками
DeepSeek V4 Pro — #49 с 1458 очками
В том же снимке SWE-bench Verified Claude Opus 4.8 набрал 88.6%, DeepSeek V4 Pro — 80.6%, GPT 5.4 — 80.0%, а Grok 4 — 75.0%. Оценки указывают на позицию модели в определенных задачах, но они не могут избавить потребителей от необходимости учитывать такие факторы, как управление разрешениями, тестирование и пользовательский опыт при выборе.
Claude Code и Codex: один локальный, другой в облаке
Будучи текущим лидером среди ИИ-инструментов для программирования, сила Claude Code заключается в непрерывном сотрудничестве: чтение файлов, изменение кода, запуск тестов, а затем продолжение изменений на основе результатов. Он подходит для разработчиков, которые долго работают в одном репозитории, но цена — необходимость самостоятельно управлять разрешениями терминала, контекстом и использованием.
Codex помещает задачи в изолированную среду, подходящую для диагностики проблем, написания патчей и запуска проверки, а затем возвращается для проверки результатов. Он больше похож на удаленного коллегу; чем четче разбита задача, тем стабильнее результат.
Ни один из них не является черным ящиком, который выдает результат по нажатию кнопки. Онлайн-конфигурация, изменения разрешений и операции с данными по-прежнему требуют подтверждения разработчика.
DeepSeek Harness: низкая цена, но базу строите сами
Привлекательность DeepSeek Harness заключается в низкой стоимости, длинном контексте и заменяемых моделях. V4 Pro набрал 80.6% на SWE-bench Verified, но занял 27-е место в публичном снимке Arena Agent. Этот разрыв показывает, что офлайн-оценки исправления не совпадают с опытом реальных задач. Он подходит для пользователей с высокой степенью настройки, готовых самостоятельно устанавливать, настраивать и устранять неполадки, а не для новичков или тех, кто рассматривает его как готовое программное обеспечение.
Grok Bot: не окно чата
Согласно официальному описанию продукта, Grok Bot в настоящее время находится на ранней бета-стадии. Он может входить в пользовательские инструменты и выполнять постоянные задачи в облаке, фактически предоставляя облачную среду разработки. Workflows, Automations и BuildMode уже переместили Grok от поиска в реальном времени к выполнению приложений, но объем разрешений и фактически доступных инструментов по-прежнему определяет его верхний предел. Это также причина, по которой цена Grok Bot выше, чем у обычных подписок Grok. SuperGrok Heavy, Cursor Ultra и Cursor Teams Premium — это справочные пакеты доступа, и они полностью отличаются от предыдущих планов чата и API.
Как выбрать? Зависит от вашей работы
Если вы в основном пишете код в локальном репозитории, Claude Code более удобен. Если вам нужно асинхронно обрабатывать пакет задач, Codex более подходит. Если вы хотите создать собственного агента с недорогими моделями, можете попробовать DeepSeek Harness, но выделите время на настройку и обслуживание. Если вам нужно отслеживать информацию в реальном времени, а затем передавать задачи в облако для выполнения, направление Grok Bot больше соответствует.
Трудно выбрать общего чемпиона среди четырех. Моя рекомендуемая комбинация: Grok для поиска информации в реальном времени, DeepSeek для недорогих экспериментов, а Claude Code или Codex для реализации и проверки.
