OpenAI Modelos
Explora todos los 16 modelos de OpenAI con precios detallados, ventajas y desventajas, y recomendaciones para desarrolladores.
Recomendaciones Rápidas
GPT-5.6 Sol
NUEVOFlagshipAgentic coding, complex workloads
Cuándo usar: Best for frontier agentic coding, deep research and mission-critical workloads where accuracy matters most.
Mejoras clave
- ◆GPT-5.6 flagship tier — released July 9, 2026
- ◆Price held at $5/$30 while Terra and Luna were cut on July 30
- ◆1.05M context, 128K max output, cache reads at $0.50/M (90% off)
Ventajas
- Flagship tier of the GPT-5.6 family (launched Jul 9, 2026)
- 1.05M shared context window with 128K max output
- Fast mode available at 2x base price
- Explicit cache breakpoints with 30-min minimum cache life
Desventajas
- Output still costs $30/M tokens
- No fine-tuning support yet
Rendimiento
Multimodal
GPT-5.6 Terra
NUEVOMid-tierBalanced performance & cost
Cuándo usar: The default choice for production apps, agents and high-value everyday workloads.
Mejoras clave
- ◆Price cut 20% on July 30, 2026: $2.50 → $2 input, $15 → $12 output
- ◆Cache reads at $0.20/M (90% off input)
- ◆1.05M context, 128K max output — same window as Sol
Ventajas
- Everyday default tier of GPT-5.6
- 20% price cut on Jul 30, 2026 ($2.50/$15 → $2/$12)
- Same 1.05M context as Sol at less than half the price
Desventajas
- Below Sol-level accuracy on the hardest tasks
- No Fast mode
Rendimiento
Multimodal
GPT-5.6 Luna
NUEVOLiteHigh-volume, low-latency tasks
Cuándo usar: Ideal for chatbots, classification, extraction, batch jobs and any high-volume latency-sensitive workload.
Mejoras clave
- ◆Price slashed 80% on July 30, 2026: $1 → $0.20 input, $6 → $1.20 output
- ◆Cache reads at $0.02/M — among the cheapest frontier-family caches
- ◆~1/25 of Sol list price for high-volume work
Ventajas
- Fastest and most affordable GPT-5.6 tier
- 80% price cut on Jul 30, 2026 ($1/$6 → $0.20/$1.20)
- Full 1.05M context at budget price
Desventajas
- Lowest capability tier of the family
- Not suited for deep reasoning tasks
Rendimiento
Multimodal
GPT-5.5
FlagshipCodificación agéntica, cargas de trabajo complejas
Cuándo usar: Ideal para agentes de codificación complejos, uso informático y cargas de trabajo profesionales donde la precisión es lo más importante.
Mejoras clave
- ◆SWE-bench Verified: 82,7% (+6,5 pp vs 76,2% de GPT-5.4)
- ◆Terminal-Bench: 82,7% — nuevo SOTA para codificación agéntica
- ◆Ventana de contexto de 1M conservada, 33% menos tokens vs GPT-5.4 a igual latencia
- ◆Razonamiento científico GeneBench: 28,5% (+3,2 pp sobre GPT-5.4)
- ◆Precio: $5/$30 — 2x GPT-5.4, pero entrada en caché 90% más barata a $0.50/M
Ventajas
- Codificación agéntica de última generación (82,7% Terminal-Bench)
- Ventana de contexto de 1 millón de tokens
- Igual latencia que GPT-5.4 con menos tokens
- Fuerte capacidad de investigación científica
Desventajas
- 2 veces más caro que GPT-5.4
- Aún no hay soporte para fine-tuning
- Costo de salida: $30/M tokens
Rendimiento
Multimodal
Benchmarks
Agentes que usan este modelo
7GPT-5.5 Pro
ReasoningPrecisión premium, cómputo paralelo
Cuándo usar: Úselo cuando necesite la máxima precisión para análisis legales, médicos o científicos y el costo sea secundario.
Mejoras clave
- ◆Cómputo paralelo en tiempo de prueba: ejecuta múltiples rutas de razonamiento, elige la mejor
- ◆GeneBench (razonamiento científico): 33,2% — el más alto jamás registrado
- ◆Asignación de GPU dedicada para suscriptores Pro/Business/Enterprise
- ◆Mismo contexto 1M + salida 128K que GPT-5.5 base, pero razonamiento más profundo
- ◆Prima de precio 6x ($30/$180) — justificada solo para análisis críticos
Ventajas
- Mayor precisión mediante cómputo paralelo en tiempo de prueba
- 33,2% en GeneBench (razonamiento científico)
- Asignación de GPU dedicada para suscriptores Pro
Desventajas
- 6 veces más caro que GPT-5.5 base
- Sin soporte de API por lotes
- Solo para niveles Pro/Business/Enterprise
Rendimiento
Multimodal
Benchmarks
GPT-5.5 Turbo
Mid-tierAplicaciones de alto volumen, chatbots, inferencia rápida
Cuándo usar: Ideal para aplicaciones de producción de alto volumen que necesitan calidad GPT-5.5 a menor costo — chatbots, resúmenes, clasificación.
Mejoras clave
- ◆Calidad de clase GPT-5.5 a un costo de salida ~33% menor ($20 vs $30/M)
- ◆Ventana de contexto de 200K — suficiente para la mayoría de los casos de uso en producción
- ◆Inferencia rápida: 1.5 veces más rápida que GPT-5.5 para aplicaciones en tiempo real
- ◆Misma salida máxima de 128K que GPT-5.5 base
- ◆Nivel gratuito disponible — mejor valor para despliegues de alto volumen
Ventajas
- Inteligencia de clase GPT-5.5 a menor costo
- Ventana de contexto de 200K
- Salida 33% más barata que GPT-5.5
- Inferencia rápida para aplicaciones en tiempo real
Desventajas
- Contexto más pequeño que GPT-5.5 (200K vs 1M)
- Sin soporte de fine-tuning
- Precisión de razonamiento ligeramente inferior
Rendimiento
Multimodal
Benchmarks
GPT-5.4
FlagshipCodificación, uso de computadora, trabajo de conocimiento
Cuándo usar: Excelente todoterreno para asistentes de codificación, automatización de escritorio y trabajo de conocimiento empresarial.
Mejoras clave
- ◆OSWorld: 75% — primera IA en superar la automatización de escritorio a nivel humano
- ◆33% menos errores factuales vs GPT-5.2 (reducción de alucinaciones)
- ◆Tool Search: descubre herramientas dinámicamente, reduce el uso de tokens de agentes en ~40%
- ◆Contexto: 128K → 1M tokens (aumento de 8x respecto a GPT-4o)
- ◆Salida máxima: 16K → 128K tokens (aumento de 8x), precio $2.50/$15
Ventajas
- Primera IA en superar el rendimiento humano en escritorio (75% OSWorld)
- Codificación unificada + uso de computadora + trabajo de conocimiento
- 33% menos errores factuales que GPT-5.2
- Tool Search reduce el uso de tokens para agentes
Desventajas
- Más caro que GPT-4.1
- Aún sin fine-tuning
- El precio de entrada se duplica por encima de 272K de contexto
Rendimiento
Multimodal
Benchmarks
GPT-5.4 Mini
Mid-tierCodificación y tareas de desarrollo rentables
Cuándo usar: Mejor valor para tareas de codificación de alto volumen, chatbots y cargas de trabajo de desarrollo más ligeras.
Mejoras clave
- ◆SWE-bench Pro: 54,38 % — solo 3,3 pp por debajo del 57,7 % de GPT-5.4 Estándar
- ◆6 veces más barato que GPT-5.4 Estándar ($0,75 vs $5/M de entrada)
- ◆Ventana de contexto de 400 000 — suficiente para la mayoría de las tareas de codificación
- ◆Misma salida máxima de 128 000 que el buque insignia, 90 % de ahorro en entrada en caché
- ◆Lanzado 12 días después de la versión Estándar — la variante mini más rápida jamás vista
Ventajas
- 54,38 % SWE-bench Pro (cerca del 57,7 % de la versión Estándar)
- 6 veces más barato que GPT-5.4 Estándar
- Ventana de contexto de 400 000
- Acceso gratuito disponible
Desventajas
- Calidad de razonamiento inferior a la versión Estándar
- Ventana de contexto más pequeña que el 1M completo
- Lanzado 12 días después de la versión Estándar
Rendimiento
Multimodal
Benchmarks
GPT-5.4 Nano
LiteEdge, embebido, móvil
Cuándo usar: Ideal para asistentes en el dispositivo, aplicaciones móviles y escenarios donde la latencia de red es una preocupación.
Mejoras clave
- ◆Diseñado para edge/móvil/IoT — optimizado para inferencia en el dispositivo
- ◆128K de salida máxima a pesar de 272K de contexto — la relación salida/contexto más alta
- ◆Visión + llamada a función a $0.20/M de entrada — antes solo para modelos insignia
- ◆Latencia optimizada para interacciones móviles en tiempo real
- ◆Contexto 272K frente a 1M para Standard — compensación entre velocidad y costo
Ventajas
- Costo ultrabajo para implementaciones en el borde
- Diseñado para dispositivos móviles y IoT
- 128K de salida máxima a pesar del tamaño pequeño
Desventajas
- Puntos de referencia limitados disponibles
- Ventana de contexto más pequeña
- Brecha de calidad para tareas complejas
Rendimiento
Multimodal
Benchmarks
GPT-4o
FlagshipPropósito general, multimodal
Cuándo usar: Mejor opción predeterminada para la mayoría de las aplicaciones que requieren salida multimodal de alta calidad.
Mejoras clave
- ◆Primer modelo nativamente multimodal: texto + imagen + audio en un solo modelo
- ◆2 veces más rápido que GPT-4 Turbo con un 50 % menos de costo ($2.50 vs $5/M de entrada)
- ◆Comprensión de audio nativa — sin necesidad de pipeline Whisper separado
- ◆Soporte de fine-tuning para adaptación a dominio (exclusivo de flagship)
- ◆Contexto de 128K — superado por el 1M de GPT-4.1 para tareas de documentos largos
Ventajas
- Multimodal (texto + imagen + audio)
- Excelente calidad de propósito general
- Potente llamada de funciones y modo JSON
Desventajas
- Costo más alto que las variantes mini/nano
- Contexto de 128K frente a 1M+ para los modelos 4.1 más recientes
Rendimiento
Multimodal
Benchmarks
Agentes que usan este modelo
3GPT-4o Mini
LiteTareas rápidas y rentables
Cuándo usar: Excelente para cargas de trabajo de alto volumen y sensibles al costo, como chatbots y resúmenes.
Mejoras clave
- ◆Reemplaza a GPT-3.5 Turbo: 46 % más barato, calidad significativamente mejor
- ◆Mismo contexto de 128K que GPT-4o a 1/17 del precio
- ◆Obtuvo un 82 % en MMLU — acercándose al nivel GPT-4 en tareas de conocimiento
- ◆Visión + llamada a funciones a $0.15/M — funciones anteriormente exclusivas del modelo insignia
- ◆Ajuste fino disponible — mejor relación calidad/precio para modelos ajustados
Ventajas
- Extremadamente asequible
- Mismo contexto de 128K que GPT-4o
- Admite visión + llamada a funciones
Desventajas
- Calidad de razonamiento inferior a la del modelo insignia
- No es ideal para tareas complejas de varios pasos
Rendimiento
Multimodal
Benchmarks
GPT-4.1
FlagshipCodificación, seguimiento de instrucciones
Cuándo usar: Mejor opción para asistentes de codificación y análisis de documentos largos.
Mejoras clave
- ◆Contexto: 128K → 1M tokens (salto de 8x desde GPT-4o)
- ◆SWE-bench Verified: 54,6% — mejor puntuación de codificación en el lanzamiento
- ◆Salida máxima: 32K tokens (2x los 16K de GPT-4o)
- ◆Seguimiento de instrucciones: 40% mejor en IFEval vs GPT-4o
- ◆Más barato que GPT-4o ($2 vs $2.50/M de entrada) con más capacidad
Ventajas
- Ventana de contexto de 1 millón de tokens
- Capacidad de codificación de primer nivel
- Más barato que GPT-4o con mejor contexto
Desventajas
- Más lento que mini/nano para tareas simples
- Modelo más nuevo, menos probado
Rendimiento
Multimodal
Benchmarks
Agentes que usan este modelo
82GPT-4.1 Mini
Mid-tierRendimiento equilibrado y costo
Cuándo usar: Punto óptimo para aplicaciones de producción que necesitan contexto largo sin costos de buque insignia.
Mejoras clave
- ◆Contexto de 1M a $0.40/M de entrada — 5 veces más barato que GPT-4.1 buque insignia
- ◆Mismo contexto de 1M + salida de 32K que el buque insignia para uso en producción
- ◆Soporte multimodal completo (visión, llamada de funciones, ajuste fino)
- ◆SWE-bench: 42.8% — codificación sólida a precio de gama media
- ◆Reemplazó a GPT-4o Mini para cargas de trabajo de producción de contexto largo
Ventajas
- Contexto de 1M a precio de gama media
- Codificación sólida por el precio
- Soporte multimodal completo
Desventajas
- Brecha de calidad frente al buque insignia para razonamiento complejo
- Todavía más caro que nano
Rendimiento
Multimodal
Benchmarks
GPT-4.1 Nano
LiteLatencia ultrabaja, dispositivos periféricos
Cuándo usar: Ideal para clasificación en tiempo real, extracción y pipelines de alto rendimiento.
Mejoras clave
- ◆Modelo más barato con contexto de 1M: $0.10/M entrada (GPT-3.5 Turbo costaba $0.50)
- ◆Conjunto completo de funciones en nivel ligero: visión + llamada a función + fine-tuning
- ◆Contexto: 128K → 1M (aumento de 8x respecto a los 128K de GPT-4o Mini)
- ◆Tiempos de respuesta más rápidos en la línea OpenAI — latencia típica inferior a 200 ms
- ◆Entrada en caché a $0.025/M — ahorro del 97.5% para prefijos repetidos
Ventajas
- Modelo OpenAI más barato con contexto de 1M
- Tiempos de respuesta más rápidos
- Conjunto completo de funciones (visión, FC, fine-tuning)
Desventajas
- Caída notable de calidad para tareas complejas
- No adecuado para razonamiento profundo
Rendimiento
Multimodal
Benchmarks
o3
ReasoningRazonamiento complejo, matemáticas, ciencias
Cuándo usar: Úselo para problemas que requieren razonamiento paso a paso, pruebas matemáticas y análisis científico.
Mejoras clave
- ◆ARC-AGI: 87.5 % — casi humano en tareas novedosas de razonamiento abstracto
- ◆Salida máxima: 100K tokens (4x los 25K de o1) para cadena de pensamiento profunda
- ◆Visión + llamada a función — nuevas capacidades frente al solo texto de o1
- ◆Olimpiada de Matemáticas: nivel de medalla de oro en AIME 2024 (93.3 %)
- ◆Precio: $2/$8 — 1/3 del costo de o1 Pro a $200/M
Ventajas
- Capacidad de razonamiento de última generación
- Salida máxima de 100K para cadena de pensamiento larga
- Excelente en matemáticas y ciencias
Desventajas
- Más lento debido al tiempo de pensamiento
- Sin soporte de ajuste fino
- Mayor costo por tokens de razonamiento
Rendimiento
Multimodal
Benchmarks
Agentes que usan este modelo
1o4-mini
ReasoningRazonamiento a menor costo
Cuándo usar: Mejor valor para cargas de trabajo de razonamiento — ideal para producción donde o3 es excesivo.
Mejoras clave
- ◆55% más barato que o3 ($1.10 vs $2/M de entrada) para tareas de razonamiento
- ◆Misma salida máxima de 100K que o3 — sin compromiso en la profundidad del razonamiento
- ◆Inferencia más rápida que o3 con presupuesto de pensamiento optimizado
- ◆Visión + llamada a función en nivel de razonamiento — anteriormente solo o3
- ◆Entrada en caché: $0.275/M — 75% de ahorro para indicaciones repetidas
Ventajas
- 55% más barato que o3 para razonamiento
- Misma salida máxima de 100K
- Más rápido que o3
Desventajas
- Menos capaz que o3 en los problemas más difíciles
- Sin ajuste fino
- Los tokens de razonamiento añaden costo oculto
Rendimiento
Multimodal
Benchmarks
Agentes que usan este modelo
1Comparación Lado a Lado
| Modelo | Nivel | Entrada | Salida | Contexto |
|---|---|---|---|---|
| GPT-5.6 Sol | Flagship | $5.00 | $30.00 | 1.1M |
| GPT-5.6 Terra | Mid-tier | $2.00 | $12.00 | 1.1M |
| GPT-5.6 Luna | Lite | $0.200 | $1.20 | 1.1M |
| GPT-5.5 | Flagship | $5.00 | $30.00 | 1M |
| GPT-5.5 Pro | Reasoning | $30.00 | $180.00 | 1M |
| GPT-5.5 Turbo | Mid-tier | $5.00 | $20.00 | 200K |
| GPT-5.4 | Flagship | $2.50 | $15.00 | 1M |
| GPT-5.4 Mini | Mid-tier | $0.750 | $4.50 | 400K |
| GPT-5.4 Nano | Lite | $0.200 | $1.25 | 272K |
| GPT-4o | Flagship | $2.50 | $10.00 | 128K |
| GPT-4o Mini | Lite | $0.150 | $0.600 | 128K |
| GPT-4.1 | Flagship | $2.00 | $8.00 | 1.0M |
| GPT-4.1 Mini | Mid-tier | $0.400 | $1.60 | 1.0M |
| GPT-4.1 Nano | Lite | $0.100 | $0.400 | 1.0M |
| o3 | Reasoning | $2.00 | $8.00 | 200K |
| o4-mini | Reasoning | $1.10 | $4.40 | 200K |