Reseña de GPT-6 Astra: características, precios, rendimiento y cómo se compara con Claude y GPT-5.6 Sol

11 de septiembre de 2026 a las 08:456 min de lectura482 vistas6 me gusta
GPT-6 Astra Review: Features, Pricing, Performance, and How It Compares With Claude and GPT-5.6 Sol

La respuesta corta: ¿Vale la pena actualizar?

Para la mayoría de las personas, todavía no. Pero para un tipo de usuario, la respuesta es sí, y no es una decisión difícil.

GPT-6 Astra cuesta $10 por millón de tokens de entrada y $50 por millón de tokens de salida, lo que es 2.5 veces el precio de GPT-5.6 Sol.

Sin embargo, en la única evaluación independiente de inteligencia general actualmente pública, Artificial Analysis le dio a Astra una puntuación de 61, exactamente al mismo nivel que Sol mientras queda por detrás de C.

Si todo lo que quieres es un chatbot más inteligente, pagar 2.5 veces más te compra una puntuación que no se mueve.

Donde Astra realmente se gana su sustento no es en el chat. Son las tareas agénticas.

Las pruebas de Artificial Analysis mostraron que, dentro del harness de Codex, Astra completó tareas comparables usando aproximadamente un tercio de los tokens que Sol. Con puntuaciones de codificación equivalentes, su costo por tarea fue menos de la mitad que el de Claude Fable 5.

En las pruebas de conocimiento de la organización, la tasa de alucinación de Astra también cayó del 92% al 51%, mientras que la precisión de las respuestas en realidad mejoró.

Si tu cuello de botella es trabajo complejo que requiere que un modelo se ejecute continuamente durante cuatro horas y nadie quiere hacerlo manualmente, vale la pena probar Astra esta semana.

Si principalmente usas un modelo para escribir, chatear o responder preguntas difíciles, guarda tu dinero por ahora.

Por qué esta reseña es tan cautelosa

Astra se lanzó el 3 de septiembre, y esta reseña se escribió el 4 de septiembre.

Eso significa que la mayoría de las conclusiones que circulan en línea siguen siendo, en esencia, marketing de proveedores con bata de laboratorio. El enfoque más honesto no es aceptar todo al pie de la letra, sino etiquetar claramente de dónde proviene cada tipo de dato.

Los números de la documentación oficial de OpenAI, Anthropic o Google son datos del proveedor. Los resultados que Artificial Analysis y la ARC Prize Foundation produjeron al ejecutar los modelos ellos mismos son evaluaciones independientes.

Los informes de medios que no pueden rastrearse hasta una fuente original solo pueden tratarse como información de segunda mano que no ha sido suficientemente verificada. Si OpenAI y los laboratorios externos no están de acuerdo, este artículo enumera ambos resultados en lugar de elegir solo el más halagador.

¿Qué es exactamente GPT-6 Astra?

Astra reemplaza a GPT-5.6 Sol como el modelo mejor posicionado en la línea actual de OpenAI. Su ID de API es gpt-6-astra.

Acepta texto e imágenes pero solo genera texto. Tiene una ventana de contexto de 1.05 millones de tokens, una salida máxima de 128,000 tokens y un corte de conocimiento del 30 de abril de 2026.

Los desarrolladores pueden ajustar la intensidad de razonamiento a través de reasoning.effort, que actualmente ofrece cinco configuraciones:

low

medium

high

xhigh

max

El marketing de OpenAI para este modelo es de alto perfil incluso para los estándares de sus lanzamientos anteriores.

El anuncio oficial afirma que Astra alcanza niveles de vanguardia en operación de computadoras, navegación web, ingeniería de software, ciberseguridad, investigación científica y trabajo profesional. El presidente de OpenAI, Greg Brockman, terminó una sesión informativa con los medios con la frase: "Bienvenidos a la era de la AGI".

Esa frase pertenece más a la categoría de posicionamiento de mercado que a una conclusión técnica.

Lo que los desarrolladores realmente deberían prestar atención es cómo se despliega Astra y qué nivel de seguridad conlleva.

Es el primer modelo en alcanzar el umbral de ciberseguridad "Crítico" en el Preparedness Framework de OpenAI. Para tareas ofensivas avanzadas, como escribir exploits de prueba de concepto, Astra simplemente se negará.

Al mismo tiempo, OpenAI está ejecutando un sistema de monitoreo de alineación en producción. Ese sistema puede terminar una tarea a mitad de su ejecución.

Si usas Astra en ChatGPT o Codex, el sistema generalmente te pedirá que apruebes la acción correspondiente. Si lo llamas a través de la API, la tarea puede detenerse por completo sin esperar confirmación.

Para cualquiera que se prepare para construir productos sobre Astra, esta limitación importa mucho más que una puntuación de benchmark en la página de lanzamiento. Al diseñar flujos de trabajo empresariales, es mejor prepararse de antemano para interrupciones de tareas.

Sus nuevas capacidades

Astra ya no se limita a estar en una ventana de chat respondiendo preguntas. Puede operar directamente una computadora.

Por ejemplo, puede completar formularios, actualizar registros de CRM, instalar y probar software, o ejecutar controles de calidad de front-end en un sitio web que generó diez minutos antes.

Los datos publicados por OpenAI muestran que Astra obtuvo un 72.6% en OSWorld 2.0, por encima del 65.7% de Sol. El tiempo promedio para completar una sola tarea también cayó de aproximadamente 75 minutos a alrededor de 40 minutos.

En Codex, Astra también cambia cómo funciona la memoria entre ventanas de contexto.

En el pasado, cuando una tarea excedía la ventana de contexto, el sistema generalmente comprimía la información existente en un resumen. Ahora Astra puede mantener notas de trabajo y mantener el contexto anterior disponible para búsqueda.

Los resúmenes comprimidos a menudo preservan solo el resultado, como "la corrección falló", mientras pierden el proceso de por qué falló. Las notas de trabajo tienen la oportunidad de preservar esa razón.

Por ahora, esta capacidad todavía se ofrece como una opción de configuración experimental. OpenAI planea convertirla en predeterminada en las próximas semanas.

OpenAI también dice que Astra puede generar documentos, hojas de cálculo y presentaciones genuinamente utilizables. No solo puede seguir plantillas proporcionadas por el usuario, sino también extraer solo el contexto relevante, evitando llenar los resultados con contenido no relacionado.

Aun así, no te apresures a juzgar su calidad de escritura y presentación. Hay una regresión muy importante más adelante en este artículo.

Desde una perspectiva de diseño de producto, mi característica favorita es cómo Astra maneja requisitos vagos.

Cuando la descripción de una tarea no es lo suficientemente clara, puede hacerte preguntas de forma asíncrona en Codex mientras continúa trabajando en las partes que no dependen de la respuesta. Incluso si nunca respondes, puede continuar con valores predeterminados razonables.

Cualquiera que haya visto a un agente quedarse atascado durante 20 minutos en una pregunta de sí o no debería entender inmediatamente el valor de esta capacidad.

En cuanto a la mejora más confiable de este lanzamiento, proviene de la evaluación independiente.

En la prueba AA-Omniscience de Artificial Analysis, Astra con máxima intensidad de razonamiento redujo su tasa de alucinación del 92% de Sol al 51%, mientras que la precisión mejoró en 4 puntos porcentuales.

Si pudiera elegir solo un dato de todo el lanzamiento como base para una decisión de producto, elegiría este.

Precio y disponibilidad de GPT-6 Astra

Los siguientes precios provienen de la página oficial de precios de OpenAI y se calculan por millón de tokens.

Reseña de GPT-6 Astra: características, precios, rendimiento y cómo se compara con Claude y GPT-5.6 Sol

Presta especial atención a la línea de 272K.

Una vez que una sola solicitud supera los 272K tokens, el excedente no se factura por separado. Toda la solicitud se factura a 2 veces el precio de entrada y 1.5 veces el precio de salida.

Así que un prompt sobredimensionado no creará unos pocos centavos de error. Puede hacer que toda la factura salte de repente.

Además, el modo Fast no admite residencia de datos en la UE. Si se utiliza procesamiento regional, el costo aumenta otro 10%.

Un día después del lanzamiento de Astra, la disponibilidad sigue siendo incompleta.

La documentación de OpenAI dice que los clientes empresariales recibirán acceso prioritario a través del Trusted Access Program. Los usuarios de API, Plus, Pro, Business y Enterprise se implementarán durante "los próximos días".

Enterprise no habilitará Astra de forma predeterminada. Un administrador empresarial debe activarlo manualmente.

Los usuarios de Pro, Business y Enterprise también obtendrán GPT-6 Astra Pro. Azure y Amazon Bedrock son los primeros socios de plataforma en la nube, y los clientes de API elegibles pueden solicitar retención cero de datos.

En cuanto a las suscripciones, ChatGPT Plus generalmente cuesta $20 por mes, y Pro cuesta $200 por mes. Claude Pro también cuesta $20, mientras que Max viene en dos niveles a $100 y $200 por mes.

El uso de Astra cuenta contra los límites del plan existente. Una vez excedidos, se pueden comprar créditos adicionales.

Actualmente, diferentes sitios de precios de terceros se contradicen entre sí sobre los niveles intermedios de OpenAI. Antes de comprar realmente, confía en la página oficial, y tampoco confíes solo en este artículo.

## GPT-6 Astra vs. GPT-5.6 Sol

Esta es la comparación clave que decide si actualizar, y los resultados no son tan bonitos como el marketing de OpenAI.

Artificial Analysis le da tanto a Astra como a Sol una puntuación de índice de inteligencia de 61.

Aunque Astra reduce los tokens de salida en aproximadamente un 10% con máxima intensidad de razonamiento, su precio unitario es 2.5 veces mayor, por lo que el costo final por tarea sigue siendo aproximadamente un 75% más alto.

Esas son las malas noticias.

Las buenas noticias aparecen en las pruebas de agentes de codificación.

En el Coding Agent Index, Astra en Codex obtuvo 67, mientras que Sol obtuvo 65. Más importante aún, Astra logró la puntuación más alta usando aproximadamente un tercio de los tokens.

Cuando ambos modelos se configuran con máxima intensidad de razonamiento, el costo por tarea de Astra es básicamente el mismo que el de Sol, pero su puntuación es 2 puntos más alta.

Este no es un eslogan de marketing vago. Es una ganancia de eficiencia real, y es el resultado verificado de forma independiente más convincente de este lanzamiento.

Los propios datos de agentes de OpenAI son aún más dramáticos:

Terminal-Bench 4.0: Astra 57.9%, Sol 37.3%

AutomationBench: Astra 41.4%, Sol 18.1%

ScreenSpot-Pro: Astra 92.7%, Sol 76.9%

Terminal-Bench Science: Astra 64.6%, Sol 22.4%

Incluso si solo la mitad de esas ganancias pueden reproducirse en evaluaciones de terceros, la brecha generacional sigue siendo real.

El problema es que esta brecha está casi enteramente concentrada en tareas agénticas.

Antes de migrar, también hay un problema práctico que no debe ignorarse: el precio promocional de Sol de $4 por millón de tokens de entrada y $20 por millón de tokens de salida durará al menos hasta el 21 de noviembre de 2026.

Si el costo te importa mucho, ese período promocional es dinero real.

Mi recomendación es esta: actualiza para trabajo de agentes y tareas de codificación en Codex. No hay necesidad de hacerlo para chat, preguntas y respuestas de conocimiento o razonamiento ordinario.

A $4 por millón de tokens de entrada y $20 por millón de tokens de salida, Sol sigue siendo la mejor relación calidad-precio para la mayoría de las tareas cotidianas.

GPT-6 Astra vs. Claude

Anthropic se lanzó dos días antes que OpenAI.

Claude Fable 5.1 se lanzó el 1 de septiembre al mismo precio: $10 por millón de tokens de entrada y $50 por millón de tokens de salida.

Tiene una ventana de contexto de 1 millón de tokens, y toda la ventana se factura bajo un único estándar sin recargo por contexto largo. Su longitud máxima de salida es de 128,000 tokens, y ofrece un modo de pensamiento adaptativo cuya intensidad puede ajustarse mediante parámetros.

La verdadera brecha de costos proviene del precio de lectura de caché.

La tarifa de acierto de caché de Fable 5.1 es solo 0.025 veces el precio base de entrada, o $0.25 por millón de tokens. La de Astra es $1.

Cada vez que un agente llama a una herramienta, a menudo tiene que releer una gran cantidad de contexto en caché. Eso es algo que los agentes hacen casi todos los días.

Así que en las lecturas de caché, el elemento más probable de dominar la factura, hay una diferencia de 4 veces entre los dos.

En cuanto a la calidad, Claude actualmente tiene la ventaja.

Artificial Analysis le da a Fable 5.1 una puntuación de índice de inteligencia de 66, mientras que Astra obtiene 61. En el Coding Agent Index, Fable 5.1 en Claude Code obtiene 70, mientras que Astra en Codex obtiene 67.

Sin embargo, si calculas el costo real por tarea de codificación, Astra cuesta menos de la mitad que Claude Fable 5 al alcanzar la misma puntuación.

La métrica que realmente tiene que responder por la factura nunca es quién tiene la puntuación total más alta. Es cuánto dinero se necesita para completar una tarea.

También hay un detalle que vale la pena elogiar: OpenAI publicó voluntariamente las áreas donde pierde.

Su tabla comparativa muestra claramente que Fable 5.1 lidera a Astra tanto en el índice de inteligencia de Artificial Analysis como en Humanity's Last Exam con herramientas. Este último obtuvo 65.0% y 57.2%, respectivamente.

Una empresa dispuesta a imprimir los datos donde pierde generalmente hace más fácil creer el resto de la tabla.

Pero tampoco debería confiarse plenamente en ella.

En una nota al pie, OpenAI afirma que algunos de los datos de BenchCAD y OSWorld de Claude utilizaron esquemas modificados descritos en la tarjeta de sistema de Anthropic. Un pequeño número de puntuaciones de ScreenSpot-Pro y ExploitGym provinieron de Mythos, que tiene menos restricciones de seguridad, en lugar del Fable estándar.

Las tablas comparativas de benchmarks entre proveedores nunca son solo resultados de pruebas puros. Son más bien documentos después de múltiples rondas de negociación. Deben leerse con eso en mente.

Hay un giro final: los informes indican que la documentación oficial de Anthropic no recomienda a los usuarios elegir Fable 5.1 de forma predeterminada.

La recomendación oficial es comenzar con Claude Opus 5, que cuesta solo la mitad. Solo cuando Opus 5 con mayor intensidad de razonamiento aún no cumpla con los requisitos de evaluación, los usuarios deberían cambiar a Fable 5.1.

Mi recomendación es esta: elige Claude si buscas calidad de razonamiento o si tu agente necesita leer caché con frecuencia. Elige Astra si la eficiencia de tokens importa o si tus tareas involucran en gran medida la operación del navegador.

GPT-6 Astra vs. Gemini

La línea actual de modelos de Google es bastante desordenada. Cualquier artículo que dé una conclusión simple directamente probablemente haya omitido información importante.

Gemini 3.8 Flash se lanzó el 2 de septiembre a un precio promocional de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida, válido hasta el 31 de diciembre de 2026.

Tiene una ventana de contexto de 1,048,576 tokens, una longitud máxima de salida de 64K y tres niveles de intensidad de pensamiento: Low, Medium y High.

A partir del 1 de enero de 2027, el precio estándar subirá a $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida.

Google lo posiciona como un modelo para ingeniería de software de horizonte largo y agentes autónomos.

El problema es que todavía está en el nivel Flash.

El actual buque insignia de nivel Pro de Google sigue siendo Gemini 3.1 Pro: por debajo de 200K tokens, cuesta $2 por millón de tokens de entrada y $12 por millón de tokens de salida. Por encima de 200K tokens, el precio sube a $4 y $18.

Gemini 3.5 Pro ha sido anunciado, pero aún no se ha lanzado oficialmente.

Así que cuando la gente dice "el último buque insignia de Google", primero necesitas determinar si se refieren al más nuevo por fecha de lanzamiento o al más alto por posicionamiento.

Artificial Analysis le da a Gemini 3.8 Flash una puntuación de índice de inteligencia de 59, solo 2 puntos por debajo de Astra. Su precio de entrada, sin embargo, es solo aproximadamente una decimotercera parte del de Astra.

Ese es el argumento competitivo más fuerte de Gemini:

Puedes obtener aproximadamente el 97% del rendimiento del benchmark de inteligencia general de Astra por aproximadamente el 7% del costo de entrada.

Lo que realmente sacrificas es la profundidad agéntica.

Los datos publicados por OpenAI muestran que en Terminal-Bench 4.0, Gemini 3.8 Flash obtiene solo 19.1%, mientras que Astra alcanza 57.9%.

Esa prueba fue ejecutada por OpenAI, por lo que debe descontarse apropiadamente. Aun así, una brecha de casi 39 puntos porcentuales no puede ser causada enteramente por el sesgo del harness.

Mi recomendación es esta: si necesitas procesar texto a gran escala, Gemini 3.8 Flash es la opción con mejor relación calidad-precio. Si necesitas que un agente opere software de forma autónoma, no es la respuesta correcta.

Comparación solo de datos verificados

Reseña de GPT-6 Astra: características, precios, rendimiento y cómo se compara con Claude y GPT-5.6 Sol

Las puntuaciones de índice aquí provienen de pruebas independientes de Artificial Analysis, mientras que los precios y las especificaciones provienen de la documentación oficial de cada proveedor.

Las celdas en blanco no significan que los datos relevantes no existan. Solo significan que, al momento de escribir este artículo, no se había encontrado ninguna cifra verificable.

La controversia de los 37 puntos

En el lanzamiento, OpenAI promocionó mucho la puntuación de Astra de 99.9% en ARC-AGI-3. Ese benchmark fue diseñado específicamente para evitar que los modelos dependan de datos de entrenamiento memorizados.

Sin embargo, ARC Prize publicó sus propios resultados de evaluación el mismo día.

En el harness Standard neutral respecto al proveedor, Astra obtuvo 62.7%, con un costo de cómputo de aproximadamente $26,098.

El 99.9% promocionado por OpenAI provino del harness Provider Adapter.

Ese harness puede preservar el estado de razonamiento opaco a través de múltiples solicitudes y comprimir conversaciones largas, permitiendo que el modelo continúe usando el trabajo que había completado previamente. El costo total de esa prueba fue de aproximadamente $18,817.

Ninguno de los dos números es falso.

Simplemente miden dos formas diferentes de ejecutar el modelo. ARC Prize también ha dicho que marcará estos dos tipos de condiciones de prueba por separado en su tabla de clasificación en el futuro.

Debe declararse claramente que incluso bajo el harness Standard más estricto, 62.7% sigue siendo el mejor resultado disponible actualmente.

Aun así, lo que seguía atrayendo mi atención no era 62.7% o 99.9%. Era otro número.

En el 96% de los niveles, Astra usó menos operaciones que el participante humano mediano en la prueba. En promedio, usó 51.7% menos operaciones por nivel.

ARC Prize originalmente esperaba que los modelos eventualmente resolvieran estos acertijos novedosos, pero que lo harían dando tumbos mediante prueba y error.

Astra sí resolvió los problemas, pero no dio tumbos.

Esa conclusión es mucho más estrecha que "la AGI ya está aquí", pero también es mucho más creíble.

Seis pruebas que deberías ejecutar tú mismo

Antes de mover cualquier presupuesto, ejecuta las siguientes seis pruebas usando tu propia cuenta. Cada una se corresponde con una afirmación central hecha anteriormente en este artículo.

1. En Codex, haz que Astra y Sol completen la misma tarea de refactorización de múltiples archivos con máxima intensidad de razonamiento. No compares solo el tiempo de ejecución. Cuenta los tokens de salida totales y el costo final. Artificial Analysis encontró que Astra usó aproximadamente dos tercios menos de tokens. Necesitas confirmar si tu propia base de código ve el mismo efecto.

2. Prepara 20 preguntas de tu propio campo profesional cuyas respuestas puedan verificarse, con la mitad de ellas cubriendo material relativamente oscuro. Dáselas a Astra y Sol por separado, y cuenta los casos donde la respuesta es segura pero incorrecta. Las evaluaciones independientes muestran que la tasa de alucinación relevante cae del 92% al 51%.

3. Carga un conjunto de documentos mayor a 300K tokens, luego pide un dato enterrado en el medio. En este punto, ten claro que has cruzado el umbral de 272K, y el precio de entrada para toda la solicitud se duplicará.

4. Simula un agente haciendo 500 llamadas a herramientas mientras relee repetidamente 150K tokens en caché. El precio de lectura de caché de Astra es $1 por millón de tokens, mientras que el de Fable 5.1 es $0.25. Antes de diseñar la arquitectura del sistema en torno a cualquiera de los dos modelos, calcula esa factura.

5. Realiza una tarea legal pero relacionada con seguridad, como revisar tu propio código en busca de vulnerabilidades de inyección, y cuenta cuántas veces el sistema de monitoreo pausa o termina la tarea. OpenAI ha reconocido claramente que este mecanismo puede marcar falsamente trabajo legítimo.

6. Usando el mismo brief, haz que Astra y Sol generen cada uno una presentación completamente formateada. Los resultados de Artificial Analysis muestran que la puntuación Elo de calidad de presentación de Astra disminuyó en lugar de mejorar, aunque su calidad de análisis mejoró.

Fortalezas y debilidades

Lo que realmente hace bien:

Su ventaja más destacada es la eficiencia de tokens dentro del harness de agentes, y esto ha sido verificado de forma independiente.

Su tasa de alucinación se reduce aproximadamente a la mitad sin sacrificar precisión. Las capacidades de operación de computadoras y automatización de navegador también lideran en todas las pruebas disponibles, y por un margen bastante amplio.

Tiene una ventana de contexto de 1.05 millones de tokens y un límite de salida de 128,000 tokens, con recuperación de contexto largo relativamente estable. En la prueba MRCR de 512K a 1M de OpenAI, obtuvo 96.3%.

Los clientes de API elegibles también pueden usar retención cero de datos.

Dónde se queda corto:

En comparación con el Sol al que reemplaza, Astra no muestra ninguna mejora medible en evaluaciones independientes de inteligencia general, mientras que su precio sube a 2.5 veces.

Artificial Analysis incluso encontró regresiones claras en varias áreas: GDPval-AA v2 cayó alrededor de 80 Elo; τ³-Banking, SciCode y el razonamiento de contexto largo cayeron cada uno entre 2 y 3 puntos porcentuales.

La calidad de presentación también es peor. Sol sigue por delante.

El precipicio de precios de 272K tokens castiga exactamente el tipo de tareas de texto largo que una ventana de contexto de 1.05 millones más anima a los usuarios a probar.

El monitoreo de alineación en producción también puede terminar tareas legítimas. En ChatGPT o Codex, al menos preguntará al usuario. En la API, puede detener la ejecución por completo.

Un día después del lanzamiento, la disponibilidad de Astra sigue siendo incompleta.

Más sutilmente, la propia evaluación de OpenAI encontró que el proceso de razonamiento escrito de Astra es más difícil de monitorear que el de Sol. La empresa divulgó este problema voluntariamente y lo listó como una prioridad para investigación adicional.

Quién no debería elegir Astra

Sé honesto sobre en qué categoría te encuentras, porque la mayoría de los lectores están en las siguientes.

Si principalmente usas un modelo para chatear, pagar 2.5 veces más compra exactamente el mismo índice de inteligencia independiente. Sigue usando Sol, o cambia a Gemini 3.8 Flash y ahorra la diferencia.

Si buscas la calidad de razonamiento puro más fuerte disponible ahora mismo, Claude Fable 5.1 lidera por 5 puntos en el índice independiente. La respuesta es Claude, no Astra.

Si tu presupuesto es limitado y tu volumen de llamadas es alto, Gemini 3.8 Flash cuesta solo una decimotercera parte por entrada, mientras que su índice de inteligencia es solo 2 puntos más bajo. No importa cómo lo calcules, Astra no puede ganar esa comparación de valor.

Si tu trabajo implica hacer diapositivas, informes y entregables finamente formateados, la calidad de presentación de Astra ha retrocedido. Debes probarlo tú mismo antes de cambiar.

Si trabajas en ciberseguridad defensiva, Astra todavía se niega a generar exploits de prueba de concepto en el lanzamiento, y el sistema de monitoreo puede terminar una tarea a mitad de camino.

OpenAI planea relajar gradualmente estas restricciones a través del programa Daybreak, pero eso aún no se ha completado.

Si necesitas una dependencia de producción estable y auditada hoy, entonces un modelo que tiene un día de antigüedad y todavía se está implementando claramente no es una opción ideal.

Qué usuarios deberían elegir qué

Reseña de GPT-6 Astra: características, precios, rendimiento y cómo se compara con Claude y GPT-5.6 Sol

Las alternativas que son fáciles de pasar por alto

Claude Opus 5 cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida, sin embargo, a menudo se pasa por alto.

La propia documentación de Anthropic recomienda que los usuarios comiencen con este modelo. Cuesta la mitad que los dos modelos de primer nivel, y en la tabla publicada por OpenAI, su índice de inteligencia de Artificial Analysis alcanza 63.1, más alto que el de Astra.

GPT-5.6 Terra cuesta $2 por millón de tokens de entrada y $12 por millón de tokens de salida. Luna llega hasta $0.20 y $1.20.

Una gran cantidad de trabajo no necesita un modelo insignia de vanguardia en absoluto. La mayor parte del tráfico de producción del mundo real cae en esta categoría.

Si tu negocio necesita entrada nativa de video o audio, puedes elegir Gemini 3.1 Pro a $2 por millón de tokens de entrada y $12 por millón de tokens de salida. Astra actualmente no admite ninguna de las dos formas de entrada en absoluto.

La respuesta más madura es cada vez más el enrutamiento multimodelo.

Cuando la diferencia de precio entre diferentes modelos de vanguardia es más de diez veces, mientras que la brecha de calidad es de solo unos pocos puntos de índice, insistir en usar solo un modelo parece una elección de arquitectura técnica en la superficie pero es esencialmente una decisión de presupuesto.

Reflexiones finales

GPT-6 Astra sí representa un progreso, pero ese progreso está concentrado en una dirección estrecha pero extremadamente importante, y el marketing de OpenAI ha superado con creces las mediciones actualmente disponibles.

Sus capacidades agénticas resisten el escrutinio inicial: la eficiencia de tokens mejora sustancialmente, la tasa de alucinación cae aproximadamente a la mitad, y las puntuaciones de operación de computadoras lideran por un margen demasiado grande para atribuirlo enteramente a diferencias de harness.

ARC Prize encontró que en el 96% de los niveles, Astra completó tareas usando menos operaciones que la mediana humana. Ese puede ser el resultado más interesante de todo el lanzamiento, y el que más vale la pena seguir observando.

Si delegas tareas complejas de múltiples horas y múltiples pasos a un modelo, entonces esta semana deberías ejecutar las seis pruebas enumeradas anteriormente contra tu propia carga de trabajo.

Pero el supuesto "salto en inteligencia general" todavía no tiene suficiente evidencia.

En esta etapa, el único índice integral independiente muestra a Astra exactamente al mismo nivel que el Sol al que reemplaza, mientras que queda por detrás del modelo insignia de Anthropic, a 2.5 veces el precio de Sol.

Por supuesto, este es solo un conjunto de pruebas de un evaluador, completado un día después del lanzamiento del modelo. Es muy probable que las puntuaciones sigan cambiando en el futuro.

Las opiniones expresadas en este artículo son las del autor y no reflejan necesariamente la posición oficial de AICompareNet. La información se proporciona solo como orientación general y puede no estar actualizada. Verifique los detalles de forma independiente antes de tomar decisiones basadas en este contenido.