OpenAI 模型
探索 OpenAI 的所有 16 个模型,包括详细定价、优缺点和开发者推荐。
快速推荐
GPT-5.6 Sol
新增FlagshipAgentic coding, complex workloads
适用场景: Best for frontier agentic coding, deep research and mission-critical workloads where accuracy matters most.
核心升级
- ◆GPT-5.6 flagship tier — released July 9, 2026
- ◆Price held at $5/$30 while Terra and Luna were cut on July 30
- ◆1.05M context, 128K max output, cache reads at $0.50/M (90% off)
优点
- Flagship tier of the GPT-5.6 family (launched Jul 9, 2026)
- 1.05M shared context window with 128K max output
- Fast mode available at 2x base price
- Explicit cache breakpoints with 30-min minimum cache life
缺点
- Output still costs $30/M tokens
- No fine-tuning support yet
性能
多模态能力
GPT-5.6 Terra
新增Mid-tierBalanced performance & cost
适用场景: The default choice for production apps, agents and high-value everyday workloads.
核心升级
- ◆Price cut 20% on July 30, 2026: $2.50 → $2 input, $15 → $12 output
- ◆Cache reads at $0.20/M (90% off input)
- ◆1.05M context, 128K max output — same window as Sol
优点
- Everyday default tier of GPT-5.6
- 20% price cut on Jul 30, 2026 ($2.50/$15 → $2/$12)
- Same 1.05M context as Sol at less than half the price
缺点
- Below Sol-level accuracy on the hardest tasks
- No Fast mode
性能
多模态能力
GPT-5.6 Luna
新增LiteHigh-volume, low-latency tasks
适用场景: Ideal for chatbots, classification, extraction, batch jobs and any high-volume latency-sensitive workload.
核心升级
- ◆Price slashed 80% on July 30, 2026: $1 → $0.20 input, $6 → $1.20 output
- ◆Cache reads at $0.02/M — among the cheapest frontier-family caches
- ◆~1/25 of Sol list price for high-volume work
优点
- Fastest and most affordable GPT-5.6 tier
- 80% price cut on Jul 30, 2026 ($1/$6 → $0.20/$1.20)
- Full 1.05M context at budget price
缺点
- Lowest capability tier of the family
- Not suited for deep reasoning tasks
性能
多模态能力
GPT-5.5
Flagship智能编码,复杂工作负载
适用场景: 最适合需要高精度的复杂编码代理、计算机使用和专业工作负载。
核心升级
- ◆SWE-bench Verified:82.7%(比GPT-5.4的76.2%高6.5个百分点)
- ◆Terminal-Bench:82.7%——智能编码新SOTA
- ◆保留100万上下文窗口,相同延迟下比GPT-5.4少33%的token
- ◆GeneBench科学推理:28.5%(比GPT-5.4高3.2个百分点)
- ◆价格:$5/$30——是GPT-5.4的2倍,但缓存输入便宜90%,仅$0.50/百万
优点
- 最先进的智能编码(Terminal-Bench 82.7%)
- 100万token上下文窗口
- 以更少的token匹配GPT-5.4的延迟
- 强大的科学研究能力
缺点
- 比GPT-5.4贵2倍
- 尚不支持微调
- 输出成本为每百万token 30美元
性能
多模态能力
基准测试
GPT-5.5 Pro
Reasoning卓越准确性,并行计算
适用场景: 当您需要法律、医疗或科学分析的最大准确性且成本次要时使用。
核心升级
- ◆并行测试时计算:运行多个推理路径,选择最佳结果
- ◆GeneBench(科学推理):33.2%——有史以来最高记录
- ◆为Pro/Business/Enterprise订阅者提供专用GPU分配
- ◆与GPT-5.5基础版相同的1M上下文+128K输出,但推理更深
- ◆6倍价格溢价($30/$180)——仅适用于关键任务分析
优点
- 通过并行测试时计算实现最高准确性
- GeneBench(科学推理)上达到33.2%
- 为Pro订阅者提供专用GPU分配
缺点
- 比GPT-5.5基础版贵6倍
- 不支持批量API
- 仅限Pro/Business/Enterprise层级
性能
多模态能力
基准测试
GPT-5.5 Turbo
Mid-tier高流量应用、聊天机器人、快速推理
适用场景: 最适合需要GPT-5.5质量但成本更低的高流量生产应用——聊天机器人、摘要、分类。
核心升级
- ◆GPT-5.5级别的质量,输出成本降低约33%($20 vs $30/M)
- ◆200K上下文窗口——足以满足大多数生产用例
- ◆快速推理:比GPT-5.5快1.5倍,适用于实时应用
- ◆与GPT-5.5基础版相同的128K最大输出
- ◆提供免费套餐——高流量部署的最佳价值
优点
- GPT-5.5级别的智能,成本更低
- 200K上下文窗口
- 输出成本比GPT-5.5低33%
- 实时应用的快速推理
缺点
- 上下文比GPT-5.5小(200K vs 1M)
- 不支持微调
- 推理准确性略低
性能
多模态能力
基准测试
GPT-5.4
Flagship编程、计算机使用、知识工作
适用场景: 适用于编程助手、桌面自动化和企业知识工作的优秀全能型产品。
核心升级
- ◆OSWorld:75%——首个超越人类桌面自动化水平的AI
- ◆比GPT-5.2减少33%的事实错误(减少幻觉)
- ◆Tool Search:动态发现工具,将智能体令牌使用量减少约40%
- ◆上下文:128K → 1M令牌(相比GPT-4o提升8倍)
- ◆最大输出:16K → 128K令牌(提升8倍),价格$2.50/$15
优点
- 首个超越人类桌面性能的AI(OSWorld 75%)
- 统一编程+计算机使用+知识工作
- 比GPT-5.2减少33%的事实错误
- Tool Search减少智能体的令牌使用量
缺点
- 比GPT-4.1更贵
- 尚未支持微调
- 超过272K上下文时输入价格翻倍
性能
多模态能力
基准测试
GPT-5.4 Mini
Mid-tier经济高效的编码与开发任务
适用场景: 适用于高容量编码任务、聊天机器人和较轻的开发工作负载的最佳性价比选择。
核心升级
- ◆SWE-bench Pro: 54.38% — 仅比 GPT-5.4 Standard 的 57.7% 低 3.3 个百分点
- ◆价格仅为 GPT-5.4 Standard 的 1/6($0.75 vs $5/百万输入)
- ◆400K 上下文窗口 — 足以应对大多数编码任务
- ◆与旗舰版相同的 128K 最大输出,缓存输入节省 90%
- ◆在 Standard 发布 12 天后推出 — 有史以来最快的迷你版本
优点
- SWE-bench Pro 得分 54.38%(接近 Standard 的 57.7%)
- 价格仅为 GPT-5.4 Standard 的 1/6
- 400K 上下文窗口
- 提供免费套餐
缺点
- 推理质量低于 Standard
- 上下文窗口小于完整的 1M
- 在 Standard 发布 12 天后推出
性能
多模态能力
基准测试
GPT-5.4 Nano
Lite边缘计算、嵌入式系统、移动设备
适用场景: 适用于设备端助手、移动应用以及网络延迟敏感的场景。
核心升级
- ◆专为边缘/移动/物联网设计——优化设备端推理
- ◆272K上下文下128K最大输出——最高输出/上下文比
- ◆视觉+函数调用仅$0.20/M输入——此前仅旗舰级支持
- ◆针对实时移动交互优化延迟
- ◆上下文272K对比标准版1M——速度与成本的权衡
优点
- 边缘部署超低成本
- 专为移动和物联网设备设计
- 小尺寸下仍支持128K最大输出
缺点
- 可用基准测试有限
- 上下文窗口较小
- 复杂任务质量差距
性能
多模态能力
基准测试
GPT-4o
Flagship通用用途,多模态
适用场景: 大多数需要高质量多模态输出的应用的最佳默认选择。
核心升级
- ◆首个原生多模态模型:文本+图像+音频集成于一体
- ◆速度比GPT-4 Turbo快2倍,成本降低50%(输入$2.50 vs $5/M)
- ◆原生音频理解——无需单独的Whisper管道
- ◆支持领域适应的微调(旗舰专属)
- ◆128K上下文——在长文档任务中被GPT-4.1的1M上下文取代
优点
- 多模态(文本+图像+音频)
- 出色的通用质量
- 强大的函数调用和JSON模式
缺点
- 相比mini/nano变体成本更高
- 128K上下文,而较新的4.1模型支持1M+
性能
多模态能力
基准测试
使用此模型的智能体
3GPT-4o Mini
Lite快速、经济高效的任务
适用场景: 非常适合高容量、对成本敏感的工作负载,如聊天机器人和摘要生成。
核心升级
- ◆取代GPT-3.5 Turbo:便宜46%,质量显著提升
- ◆与GPT-4o相同的128K上下文,价格仅为1/17
- ◆在MMLU上得分82%——接近GPT-4在知识任务上的水平
- ◆视觉+函数调用仅$0.15/M——此前仅为旗舰功能
- ◆支持微调——调优模型中最佳性价比
优点
- 极其实惠
- 与GPT-4o相同的128K上下文
- 支持视觉+函数调用
缺点
- 推理质量低于旗舰模型
- 不适合复杂的多步骤任务
性能
多模态能力
基准测试
GPT-4.1
Flagship编程、指令遵循
适用场景: 编程助手和长文档分析的首选。
核心升级
- ◆上下文:128K → 100万token(相比GPT-4o提升8倍)
- ◆SWE-bench Verified:54.6%——发布时最佳编程得分
- ◆最大输出:32K token(是GPT-4o的16K的两倍)
- ◆指令遵循:IFEval相比GPT-4o提升40%
- ◆比GPT-4o更便宜(每百万输入$2 vs $2.50),功能更强
优点
- 100万token上下文窗口
- 同类最佳的编程能力
- 比GPT-4o更便宜且上下文更好
缺点
- 对于简单任务比mini/nano慢
- 较新模型,经过的测试较少
性能
多模态能力
基准测试
使用此模型的智能体
82GPT-4.1 Mini
Mid-tier平衡性能与成本
适用场景: 适合需要长上下文但无需旗舰成本的生产应用的最佳选择。
核心升级
- ◆100万上下文,输入$0.40/M — 比GPT-4.1旗舰便宜5倍
- ◆与旗舰相同的100万上下文+32K输出,适用于生产环境
- ◆全面的多模态支持(视觉、函数调用、微调)
- ◆SWE-bench: 42.8% — 中端价格下的强大编码能力
- ◆取代GPT-4o Mini用于长上下文生产工作负载
优点
- 中端价格下的100万上下文
- 价格下强大的编码能力
- 全面的多模态支持
缺点
- 复杂推理方面与旗舰产品存在质量差距
- 仍比nano贵
性能
多模态能力
基准测试
GPT-4.1 Nano
Lite超低延迟,边缘设备
适用场景: 非常适合实时分类、提取和高吞吐量管道。
核心升级
- ◆最便宜的1M上下文模型:$0.10/M输入(GPT-3.5 Turbo为$0.50)
- ◆轻量级完整功能集:视觉+函数调用+微调
- ◆上下文:128K → 1M(比GPT-4o Mini的128K增加8倍)
- ◆OpenAI系列中最快的响应时间——典型延迟低于200毫秒
- ◆缓存输入$0.025/M——重复前缀节省97.5%
优点
- 最便宜的OpenAI模型,支持1M上下文
- 最快的响应时间
- 完整功能集(视觉、FC、微调)
缺点
- 复杂任务质量明显下降
- 不适合深度推理
性能
多模态能力
基准测试
o3
Reasoning复杂推理、数学、科学
适用场景: 用于需要逐步推理、数学证明和科学分析的问题。
核心升级
- ◆ARC-AGI: 87.5% — 在新颖抽象推理任务上接近人类水平
- ◆最大输出: 100K令牌(是o1的25K的4倍),支持深度链式思维
- ◆视觉+函数调用 — 相比o1仅文本的新能力
- ◆数学奥林匹克: AIME 2024金牌水平(93.3%)
- ◆价格: $2/$8 — 仅为o1 Pro每月$200成本的1/3
优点
- 最先进的推理能力
- 100K最大输出,支持长链思维
- 在数学和科学方面表现出色
缺点
- 因思考时间而速度较慢
- 不支持微调
- 推理令牌成本较高
性能
多模态能力
基准测试
使用此模型的智能体
1o4-mini
Reasoning以更低成本进行推理
适用场景: 推理工作负载的最佳价值——非常适合o3过于强大的生产环境。
核心升级
- ◆推理任务比o3便宜55%($1.10 vs $2/M输入)
- ◆与o3相同的100K最大输出——推理深度无妥协
- ◆通过优化思考预算实现比o3更快的推理
- ◆推理层级的视觉+函数调用——以前仅o3支持
- ◆缓存输入:$0.275/M——重复提示节省75%
优点
- 比o3推理便宜55%
- 相同100K最大输出
- 比o3更快
缺点
- 在最难问题上能力不如o3
- 无微调
- 推理令牌增加隐藏成本
性能
多模态能力
基准测试
使用此模型的智能体
1并排比较
| 模型 | 层级 | 输入 | 输出 | 上下文 |
|---|---|---|---|---|
| GPT-5.6 Sol | Flagship | $5.00 | $30.00 | 1.1M |
| GPT-5.6 Terra | Mid-tier | $2.00 | $12.00 | 1.1M |
| GPT-5.6 Luna | Lite | $0.200 | $1.20 | 1.1M |
| GPT-5.5 | Flagship | $5.00 | $30.00 | 1M |
| GPT-5.5 Pro | Reasoning | $30.00 | $180.00 | 1M |
| GPT-5.5 Turbo | Mid-tier | $5.00 | $20.00 | 200K |
| GPT-5.4 | Flagship | $2.50 | $15.00 | 1M |
| GPT-5.4 Mini | Mid-tier | $0.750 | $4.50 | 400K |
| GPT-5.4 Nano | Lite | $0.200 | $1.25 | 272K |
| GPT-4o | Flagship | $2.50 | $10.00 | 128K |
| GPT-4o Mini | Lite | $0.150 | $0.600 | 128K |
| GPT-4.1 | Flagship | $2.00 | $8.00 | 1.0M |
| GPT-4.1 Mini | Mid-tier | $0.400 | $1.60 | 1.0M |
| GPT-4.1 Nano | Lite | $0.100 | $0.400 | 1.0M |
| o3 | Reasoning | $2.00 | $8.00 | 200K |
| o4-mini | Reasoning | $1.10 | $4.40 | 200K |