Introducción
Recientemente, DeepSeek lanzó la herramienta de código abierto DeepSeek Harness, apostando por precios bajos y acceso para desarrolladores. Casi simultáneamente, SpaceX AI lanzó Grok Bot, apostando por información en tiempo real y ejecución de agentes. Claude Code y Codex, como actores fuertes establecidos en el mismo campo, siguen siendo ferozmente competitivos.
La competencia ha pasado de comparar modelos a capturar puntos de entrada
La competencia entre los grandes modelos de IA ya no se trata solo de tablas de clasificación. Hoy, OpenAI y Anthropic aún mantienen capacidades de alta gama, pero también tienen que competir por puntos de entrada para desarrolladores, permisos de herramientas y tareas a largo plazo. DeepSeek se centra en precios bajos, contextos largos y compatibilidad de interfaces, mientras que Grok combina información en tiempo real, el ecosistema X y funciones de agente.
Las actualizaciones recientes de DeepSeek han sido intensivas. El 31 de julio, la documentación oficial de la API anunció la versión beta pública de V4 Flash, y el 13 de agosto se lanzó V4 Pro. Ambas versiones proporcionan 1M de contexto y se integran con la API de Responses y Codex. El anuncio oficial también indicó que la API se facturará según períodos pico/valle a partir de las 16:00 hora de Beijing del 16 de agosto. Pero para los desarrolladores, los modelos baratos son solo el primer paso; si pueden integrarse de manera estable en flujos de trabajo existentes es más importante.
La xAI de Musk, por otro lado, parece estar expandiendo los puntos de entrada de productos. Después de lanzar Grok 4.5 el 16 de julio, Grok entró sucesivamente en plataformas web, X y móviles, y también lanzó Workflows y BuildMode. En cuanto al modelo más reciente, los medios en línea informaron el 13 de agosto sobre los últimos avances de Grok 4.6, pero al momento de escribir esto, las evaluaciones comparativas disponibles públicamente se basan principalmente en Grok 4.5.
Los cuatro productos no están en la misma carrera
Como todos sabemos, Claude Code y Codex son pioneros en herramientas de codificación con IA, pero Claude Code está más cerca de una terminal local, mientras que Codex es más como un agente que ejecuta tareas de forma remota. DeepSeek Harness es un chasis de código abierto que requiere que combines terminales, sistemas de archivos, web y subagentes tú mismo. Grok Bot combina información en tiempo real y ejecución automatizada.
Las estrategias de precios también son bastante reveladoras dadas sus diferentes formas de producto.
Planes individuales de Claude Code: Pro a $20/mes, Max 5x a $100/mes, Max 20x a $200/mes.
ChatGPT Plus cuesta $20/mes, Pro cuesta $200/mes.
Grok Bot causa sensación; no está incluido en el paquete regular de chat de Grok, ni incluye la API de xAI de pago. La información de acceso público muestra que Grok Bot está disponible actualmente a través de SuperGrok Heavy, Cursor Ultra y Cursor Teams Premium, con precios de referencia de $300/mes para individuos, y $200/mes o $120/asiento para empresas y equipos; no hay nivel gratuito. El SuperGrok anteriormente disponible a $30/mes y SuperGrok Plus a $100/mes son suscripciones regulares de chat de Grok y no califican para el nivel de precios de Grok Bot.
Clasificaciones de la tabla de líderes de modelos
En la instantánea pública al 12 de agosto, las clasificaciones de Arena Agent son:
Claude Opus 5 High – #1 con puntuación de mejora neta 12.01
GPT 5.6 Sol xHigh – #4 con 10.80
Grok 4.5 – #15 con 6.00
DeepSeek V4 Flash High – #18 con 3.89
V4 Pro – #27 sin puntuación aún
Esta clasificación mide el rendimiento de modelo-más-configuración en tareas reales y no puede tratarse directamente como una clasificación general de los cuatro productos.
En las clasificaciones de diálogo abierto de Arena Text:
Claude Opus 5 High – #7 con 1494 puntos
GPT 5.6 Sol xHigh – #18 con 1481 puntos
Grok 4.5 – #34 con 1469 puntos
DeepSeek V4 Pro – #49 con 1458 puntos
En la misma instantánea de SWE-bench Verified, Claude Opus 4.8 obtuvo 88.6%, DeepSeek V4 Pro 80.6%, GPT 5.4 80.0% y Grok 4 75.0%. Las puntuaciones indican la posición de un modelo en ciertas tareas, pero no pueden salvar a los consumidores de considerar factores como la gestión de permisos, las pruebas y la experiencia del usuario al elegir.
Claude Code y Codex: uno local, uno en la nube
Como el líder actual entre las herramientas de codificación con IA, la fortaleza de Claude Code radica en la colaboración continua: leer archivos, modificar código, ejecutar pruebas y luego continuar modificando según los resultados. Es adecuado para desarrolladores que trabajan a largo plazo en un solo repositorio, pero el costo es que necesitas gestionar permisos de terminal, contexto y uso tú mismo.
Codex coloca las tareas en un entorno aislado, adecuado para diagnosticar problemas, escribir parches y ejecutar verificaciones, y luego regresar para revisar los resultados. Es más como un colega remoto; cuanto más clara sea la descomposición de la tarea, más estable será la entrega.
Ninguno es una caja negra que entrega con solo presionar un botón. La configuración en línea, los cambios de permisos y las operaciones de datos aún requieren confirmación del desarrollador.
DeepSeek Harness: precio bajo, pero construyes la base tú mismo
El atractivo de DeepSeek Harness radica en su bajo costo, contexto largo y modelos reemplazables. V4 Pro obtuvo 80.6% en SWE-bench Verified, pero ocupó el puesto 27 en la instantánea pública de Arena Agent. Esta brecha muestra que las puntuaciones de reparación fija fuera de línea no son lo mismo que la experiencia en tareas reales. Es adecuado para usuarios altamente personalizables que estén dispuestos a instalar, configurar y solucionar problemas ellos mismos, no para principiantes ni para quienes lo tratan como software listo para usar.
Grok Bot: no es una ventana de chat
Según la descripción oficial del producto, Grok Bot está actualmente en Early Beta. Puede iniciar sesión en herramientas de usuario y ejecutar tareas persistentes en la nube, proporcionando efectivamente un entorno de desarrollo en la nube. Workflows, Automations y BuildMode ya han movido a Grok desde la búsqueda en tiempo real hacia la ejecución de aplicaciones, pero el alcance de los permisos y las herramientas realmente accesibles aún determinan su límite superior. Esto también explica por qué el precio de Grok Bot es más alto que las suscripciones ordinarias de Grok. SuperGrok Heavy, Cursor Ultra y Cursor Teams Premium son paquetes de acceso de referencia, y son completamente diferentes de los planes de chat y API anteriores.
¿Cómo elegir? Depende de tu trabajo
Si principalmente escribes código en un repositorio local, Claude Code es más conveniente. Si necesitas manejar un lote de tareas de forma asíncrona, Codex es más adecuado. Si quieres construir tu propio agente con modelos de bajo costo, puedes probar DeepSeek Harness, pero reserva tiempo para la configuración y el mantenimiento. Si necesitas rastrear información en tiempo real y luego entregar tareas a la nube para su ejecución, la dirección de Grok Bot está más alineada.
Es difícil elegir un campeón general entre los cuatro. Mi combinación recomendada: Grok para encontrar información en tiempo real, DeepSeek para experimentación de bajo costo, y Claude Code o Codex para implementación y verificación.
