GPT-6 Astra 评测:功能、定价、性能,以及与 Claude 和 GPT-5.6 Sol 的对比

2026年9月11日 08:456 分钟阅读482 次浏览6 次点赞
GPT-6 Astra Review: Features, Pricing, Performance, and How It Compares With Claude and GPT-5.6 Sol

简短回答:值得升级吗?

对大多数人来说,还不值得。但对某一类用户来说,答案是肯定的,而且几乎没有悬念。

GPT-6 Astra 的价格为每百万输入 token 10 美元、每百万输出 token 50 美元,是 GPT-5.6 Sol 价格的 2.5 倍。

然而,在目前唯一公开的独立通用智能评估中,Artificial Analysis 给 Astra 的评分为 61,与 Sol 完全持平,同时落后于 C。

如果你想要的只是一个更聪明的聊天机器人,多付 2.5 倍的钱换来的却是一个纹丝不动的分数。

Astra 真正体现价值的地方不是聊天,而是智能体任务。

Artificial Analysis 的测试显示,在 Codex 框架内,Astra 完成同等任务所用的 token 大约只有 Sol 的三分之一。在同等编码分数下,其单任务成本不到 Claude Fable 5 的一半。

在该机构的知识测试中,Astra 的幻觉率也从 92% 降至 51%,而答案准确率实际上还有所提升。

如果你的瓶颈是需要模型连续运行四小时、没人愿意手动完成的复杂工作,那么 Astra 值得你这周就去测试。

如果你主要用模型来写作、聊天或回答难题,那暂时还是把钱留在口袋里吧。

为什么这篇评测如此谨慎

Astra 于 9 月 3 日发布,而这篇评测写于 9 月 4 日。

这意味着网上流传的大多数结论,本质上仍是披着实验室外衣的厂商营销。更诚实的做法不是全盘接受,而是清楚标注每类数据的来源。

来自 OpenAI、Anthropic 或 Google 官方文档的数字属于厂商数据。Artificial Analysis 和 ARC Prize Foundation 通过自行运行模型得出的结果属于独立评估。

无法追溯到原始来源的媒体报道,只能被视为尚未得到充分验证的二手信息。如果 OpenAI 与外部实验室存在分歧,本文会同时列出两种结果,而不是只挑更好看的那个。

GPT-6 Astra 究竟是什么?

Astra 取代 GPT-5.6 Sol,成为 OpenAI 当前产品线中定位最高的模型。其 API ID 为 gpt-6-astra。

它接受文本和图像输入,但仅输出文本。它拥有 105 万 token 的上下文窗口,最大输出 128,000 token,知识截止日期为 2026 年 4 月 30 日。

开发者可以通过 reasoning.effort 调整推理强度,目前提供五档设置:

low

medium

high

xhigh

max

即便以 OpenAI 过往发布会的标准来看,这款模型的营销也堪称高调。

官方公告声称,Astra 在计算机操作、网页浏览、软件工程、网络安全、科学研究和专业工作方面均达到最先进水平。OpenAI 总裁 Greg Brockman 在一场媒体简报会上以这样一句话收尾:“欢迎来到 AGI 时代。”

这句话更应归入市场定位的范畴,而非技术结论。

开发者真正应该关注的是 Astra 如何部署,以及它带有何种安全级别。

它是首个在 OpenAI 的 Preparedness Framework 中达到“Critical”网络安全阈值的模型。对于高级攻击性任务,例如编写概念验证漏洞利用代码,Astra 会直接拒绝。

与此同时,OpenAI 正在生产环境中运行一套对齐监控系统。该系统可以在任务执行中途将其终止。

如果你在 ChatGPT 或 Codex 中使用 Astra,系统通常会要求你批准相关操作。如果你通过 API 调用它,任务可能会直接停止,而不等待确认。

对于任何准备在 Astra 上构建产品的人来说,这一限制远比发布页上的基准分数重要。在设计业务流程时,最好提前为任务中断做好准备。

它的新能力

Astra 不再只是坐在聊天窗口里回答问题。它可以直接操作计算机。

例如,它可以填写表单、更新 CRM 记录、安装和测试软件,或对它十分钟前生成的网站进行前端质量检查。

OpenAI 公布的数据显示,Astra 在 OSWorld 2.0 上得分 72.6%,高于 Sol 的 65.7%。完成单个任务的平均时间也从约 75 分钟降至约 40 分钟。

在 Codex 中,Astra 还改变了跨上下文窗口的记忆方式。

过去,当任务超出上下文窗口时,系统通常会将现有信息压缩成摘要。现在 Astra 可以保留工作笔记,并让更早的上下文保持可检索。

压缩摘要往往只保留结果,例如“修复失败”,却丢失了失败的原因。工作笔记则有机会保留这一原因。

目前,这项能力仍以实验性配置开关的形式提供。OpenAI 计划在未来几周内将其设为默认。

OpenAI 还表示,Astra 可以生成真正可用的文档、电子表格和演示文稿。它不仅能遵循用户提供的模板,还能只提取相关上下文,避免用无关内容填充结果。

不过,先不要急于评判它的写作和演示质量。本文后面会提到一个非常重要的退步。

从产品设计的角度来看,我最喜欢的功能是 Astra 处理模糊需求的方式。

当任务描述不够清晰时,它可以在 Codex 中异步向你提问,同时继续处理不依赖该答案的部分。即使你从不回复,它也能以合理的默认值继续推进。

任何看过智能体卡在一个是或否的问题上长达 20 分钟的人,都会立刻明白这项能力的价值。

至于本次发布中最可信的改进,则来自独立评估。

在 Artificial Analysis 的 AA-Omniscience 测试中,Astra 在最高推理强度下将幻觉率从 Sol 的 92% 降至 51%,同时准确率提升了 4 个百分点。

如果我能从整个发布中只选一个数据点作为产品决策依据,我会选这个。

GPT-6 Astra 的价格与可用性

以下价格来自 OpenAI 官方定价页面,均按每百万 token 计算。

GPT-6 Astra 评测:功能、定价、性能,以及与 Claude 和 GPT-5.6 Sol 的对比

请特别注意 272K 那一行。

一旦单次请求超过 272K token,超出部分不会单独计费。整个请求都按输入价格的 2 倍、输出价格的 1.5 倍计费。

所以,一个过大的提示词不会只造成几美分的误差。它可能让整张账单突然飙升。

此外,Fast 模式不支持欧盟数据驻留。如果使用区域处理,成本还要再增加 10%。

Astra 发布一天后,可用性仍不完整。

OpenAI 文档称,企业客户将通过 Trusted Access Program 获得优先访问权。API、Plus、Pro、Business 和 Enterprise 用户将在“未来几天内”逐步开放。

Enterprise 不会默认启用 Astra。企业管理员必须手动开启。

Pro、Business 和 Enterprise 用户还将获得 GPT-6 Astra Pro。Azure 和 Amazon Bedrock 是首批云平台合作伙伴,符合条件的 API 客户可以申请零数据保留。

在订阅方面,ChatGPT Plus 通常为每月 20 美元,Pro 为每月 200 美元。Claude Pro 也是 20 美元,而 Max 分为每月 100 美元和 200 美元两档。

Astra 的使用量计入现有套餐限额。超出后,可以购买额外额度。

目前,不同第三方定价网站在 OpenAI 中间档位上说法相互矛盾。实际购买前,请以官方页面为准,也不要只相信本文。

## GPT-6 Astra 与 GPT-5.6 Sol 对比

这是决定是否升级的关键对比,而结果并不像 OpenAI 的营销那样漂亮。

Artificial Analysis 给 Astra 和 Sol 的智能指数评分均为 61。

尽管 Astra 在最高推理强度下将输出 token 减少了约 10%,但其单价高出 2.5 倍,因此最终单任务成本仍高出约 75%。

这是坏消息。

好消息出现在编码智能体测试中。

在 Coding Agent Index 上,Codex 中的 Astra 得分为 67,而 Sol 为 65。更重要的是,Astra 用大约三分之一的 token 取得了更高的分数。

当两个模型都设置为最高推理强度时,Astra 的单任务成本与 Sol 基本相同,但分数高出 2 分。

这不是含糊的营销口号。这是真实的效率提升,也是本次发布中最有说服力的、经独立验证的结果。

OpenAI 自己的智能体数据更加惊人:

Terminal-Bench 4.0:Astra 57.9%,Sol 37.3%

AutomationBench:Astra 41.4%,Sol 18.1%

ScreenSpot-Pro:Astra 92.7%,Sol 76.9%

Terminal-Bench Science:Astra 64.6%,Sol 22.4%

即使这些提升中只有一半能在第三方评估中复现,代际差距依然真实存在。

问题在于,这一差距几乎完全集中在智能体任务上。

迁移之前,还有一个不应忽视的实际问题:Sol 每百万输入 token 4 美元、每百万输出 token 20 美元的促销价至少会持续到 2026 年 11 月 21 日。

如果成本对你非常重要,那段促销期就是实打实的省钱。

我的建议是:为智能体工作和 Codex 编码任务升级。聊天、知识问答或普通推理则没有必要。

在每百万输入 token 4 美元、每百万输出 token 20 美元的价格下,Sol 对大多数日常任务来说仍是更划算的选择。

GPT-6 Astra 与 Claude 对比

Anthropic 比 OpenAI 早两天发布。

Claude Fable 5.1 于 9 月 1 日上线,价格相同:每百万输入 token 10 美元、每百万输出 token 50 美元。

它拥有 100 万 token 的上下文窗口,整个窗口按单一标准计费,没有长上下文附加费。其最大输出长度为 128,000 token,并提供自适应思考模式,强度可通过参数调整。

真正的成本差距来自缓存读取定价。

Fable 5.1 的缓存命中费用仅为基准输入价格的 0.025 倍,即每百万 token 0.25 美元。Astra 则为 1 美元。

智能体每次调用工具时,往往都要重新读取大量缓存上下文。这是智能体几乎每天都会做的事。

因此,在最可能主导账单的缓存读取上,两者相差 4 倍。

在质量方面,Claude 目前占优。

Artificial Analysis 给 Fable 5.1 的智能指数评分为 66,而 Astra 为 61。在 Coding Agent Index 上,Claude Code 中的 Fable 5.1 得分为 70,而 Codex 中的 Astra 为 67。

不过,如果计算每个编码任务的实际成本,在达到相同分数时,Astra 的成本不到 Claude Fable 5 的一半。

真正需要为账单负责的指标,从来不是谁的总分更高,而是完成一个任务要花多少钱。

还有一个值得称赞的细节:OpenAI 主动公布了它落败的领域。

其对比表清楚显示,Fable 5.1 在 Artificial Analysis 智能指数和带工具的 Humanity’s Last Exam 上都领先 Astra。后者得分分别为 65.0% 和 57.2%。

一家愿意印出自己落败数据的公司,通常会让表中其余内容更容易被相信。

但也不应完全信任。

OpenAI 在脚注中表示,Claude 的部分 BenchCAD 和 OSWorld 数据使用了 Anthropic 系统卡中描述的修改方案。少量 ScreenSpot-Pro 和 ExploitGym 分数来自安全限制更少的 Mythos,而非标准版 Fable。

跨厂商基准对比表从来都不只是纯粹的测试结果。它们更像是经过多轮协商后的文件。阅读时应牢记这一点。

最后一个反转:有报道指出,Anthropic 的官方文档并不建议用户默认选择 Fable 5.1。

官方建议从 Claude Opus 5 开始,其成本只有一半。只有当 Opus 5 在更高推理强度下仍无法满足评估要求时,用户才应切换到 Fable 5.1。

我的建议是:如果你追求推理质量,或你的智能体需要频繁读取缓存,选择 Claude。如果 token 效率很重要,或你的任务大量涉及浏览器操作,选择 Astra。

GPT-6 Astra 与 Gemini 对比

Google 当前的产品线相当混乱。任何直接给出简单结论的文章,很可能都省略了重要信息。

Gemini 3.8 Flash 于 9 月 2 日发布,促销价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,有效期至 2026 年 12 月 31 日。

它拥有 1,048,576 token 的上下文窗口,最大输出长度为 64K,并提供 Low、Medium 和 High 三档思考强度。

从 2027 年 1 月 1 日起,标准价格将上涨至每百万输入 token 1.50 美元、每百万输出 token 7.50 美元。

Google 将其定位为面向长周期软件工程和自主智能体的模型。

问题在于,它仍处于 Flash 层级。

Google 当前的 Pro 级旗舰仍是 Gemini 3.1 Pro:20 万 token 以下,每百万输入 token 2 美元、每百万输出 token 12 美元。超过 20 万 token 后,价格升至 4 美元和 18 美元。

Gemini 3.5 Pro 已宣布,但尚未正式发布。

所以当人们说“Google 最新旗舰”时,你首先需要判断他们指的是按发布日期最新,还是按定位最高。

Artificial Analysis 给 Gemini 3.8 Flash 的智能指数评分为 59,仅比 Astra 低 2 分。然而其输入价格仅为 Astra 的约十三分之一。

这是 Gemini 最强的竞争论据:

你只需花费约 7% 的输入成本,就能获得 Astra 约 97% 的通用智能基准表现。

你真正牺牲的是智能体深度。

OpenAI 公布的数据显示,在 Terminal-Bench 4.0 上,Gemini 3.8 Flash 得分仅为 19.1%,而 Astra 达到 57.9%。

该测试由 OpenAI 运行,因此应适当打折看待。即便如此,近 39 个百分点的差距也不可能完全由框架偏差造成。

我的建议是:如果你需要大规模处理文本,Gemini 3.8 Flash 是最具性价比的选择。如果你需要智能体自主操作软件,它就不是正确答案。

仅经核实数据的对比

GPT-6 Astra 评测:功能、定价、性能,以及与 Claude 和 GPT-5.6 Sol 的对比

这里的指数评分来自 Artificial Analysis 的独立测试,而价格和规格来自各厂商官方文档。

空白单元格并不意味着相关数据不存在。它们只意味着,截至本文撰写时,尚未找到可核实的数字。

37 分争议

发布时,OpenAI 大力宣传 Astra 在 ARC-AGI-3 上 99.9% 的得分。该基准专门设计用来避免模型依赖记忆的训练数据。

然而,ARC Prize 在同一天公布了自己的评估结果。

在厂商中立的 Standard 框架中,Astra 得分为 62.7%,计算成本约为 26,098 美元。

OpenAI 宣传的 99.9% 来自 Provider Adapter 框架。

该框架可以在多次请求之间保留不透明的推理状态,并压缩长对话,使模型能够继续使用此前已完成的工作。该测试的总成本约为 18,817 美元。

两个数字都不是假的。

它们只是衡量了两种不同的模型运行方式。ARC Prize 还表示,未来将在其排行榜上分别标注这两类测试条件。

必须明确说明,即使在更严格的 Standard 框架下,62.7% 仍是目前可获得的最佳结果。

不过,一直吸引我注意的并不是 62.7% 或 99.9%,而是另一个数字。

在 96% 的关卡中,Astra 使用的操作次数少于测试中人类参与者的中位数。平均而言,它每关少用 51.7% 的操作。

ARC Prize 原本预计,模型最终或许能解出这些新颖谜题,但会通过反复试错、横冲直撞的方式完成。

Astra 确实解出了问题,但它并没有横冲直撞。

这个结论比“AGI 已经到来”要窄得多,但也可信得多。

你应该自己运行的六项测试

在动用任何预算之前,请用自己的账户运行以下六项测试。每一项都对应本文前面提出的一个核心主张。

1. 在 Codex 中,让 Astra 和 Sol 在最高推理强度下完成同一个多文件重构任务。不要只比较运行时间。统计总输出 token 和最终成本。Artificial Analysis 发现 Astra 使用的 token 少了约三分之二。你需要确认自己的代码库是否也有同样效果。

2. 从你自己的专业领域准备 20 个答案可验证的问题,其中一半涉及相对冷门的材料。分别交给 Astra 和 Sol,统计答案自信但错误的情况。独立评估显示相关幻觉率从 92% 降至 51%。

3. 加载一组大于 300K token 的文档,然后询问一个埋在中间的事实。此时要清楚,你已经越过 272K 阈值,整个请求的输入价格将翻倍。

4. 模拟一个智能体进行 500 次工具调用,同时反复读取 150K 缓存 token。Astra 的缓存读取价格为每百万 token 1 美元,而 Fable 5.1 为 0.25 美元。在围绕任一模型设计系统架构之前,先算清这笔账。

5. 执行一项合法但与安全相关的任务,例如检查自己的代码是否存在注入漏洞,并统计监控系统暂停或终止任务的次数。OpenAI 已明确承认,该机制可能误报合法工作。

6. 使用同一份简报,让 Astra 和 Sol 各生成一份完整格式的演示文稿。Artificial Analysis 的结果显示,Astra 的演示质量 Elo 分数不升反降,尽管其分析质量有所提升。

优势与劣势

它真正擅长的地方:

其最突出的优势是在智能体框架内的 token 效率,而且这一点已得到独立验证。

它的幻觉率大约减半,且没有牺牲准确率。计算机操作和浏览器自动化能力在所有可用测试中也均领先,而且优势相当明显。

它拥有 105 万 token 的上下文窗口和 128,000 token 的输出上限,长上下文检索相对稳定。在 OpenAI 的 512K 至 1M MRCR 测试中,它得分 96.3%。

符合条件的 API 客户还可以使用零数据保留。

它的不足之处:

与它所取代的 Sol 相比,Astra 在独立通用智能评估中没有显示出可衡量的提升,而价格却上涨到 2.5 倍。

Artificial Analysis 甚至发现多个领域出现明显退步:GDPval-AA v2 下降约 80 Elo;τ³-Banking、SciCode 和长上下文推理各下降 2 至 3 个百分点。

演示质量也更差。Sol 仍然领先。

272K token 的价格悬崖,恰恰惩罚了 105 万上下文窗口最鼓励用户尝试的那类长文本任务。

生产环境中的对齐监控也可能终止合法任务。在 ChatGPT 或 Codex 中,它至少会询问用户。在 API 中,它可能直接停止执行。

发布一天后,Astra 的可用性仍不完整。

更微妙的是,OpenAI 自己的评估发现,Astra 的书面推理过程比 Sol 更难监控。公司主动披露了这一问题,并将其列为后续研究的优先事项。

谁不应选择 Astra

请诚实判断自己属于哪一类,因为大多数读者都属于下面这些类别。

如果你主要用模型聊天,多付 2.5 倍的钱换来的独立智能指数完全相同。继续用 Sol,或者改用 Gemini 3.8 Flash,把差价省下来。

如果你追求目前最强的纯推理质量,Claude Fable 5.1 在独立指数上领先 5 分。答案是 Claude,而不是 Astra。

如果你预算有限且调用量很大,Gemini 3.8 Flash 的输入成本仅为十三分之一,而智能指数只低 2 分。无论怎么算,Astra 都赢不了这场性价比对比。

如果你的工作涉及制作幻灯片、报告和精细格式的交付物,Astra 的演示质量已经退步。切换前必须自己测试。

如果你从事防御性网络安全工作,Astra 在发布时仍拒绝生成概念验证漏洞利用代码,而且监控系统可能在任务中途将其终止。

OpenAI 计划通过 Daybreak 计划逐步放宽这些限制,但目前尚未完成。

如果你今天就需要一个稳定、经过审计的生产依赖,那么一个刚发布一天、仍在逐步开放的模型显然不是理想选择。

哪些用户应选择什么

GPT-6 Astra 评测:功能、定价、性能,以及与 Claude 和 GPT-5.6 Sol 的对比

容易被忽视的替代方案

Claude Opus 5 的价格为每百万输入 token 5 美元、每百万输出 token 25 美元,却常常被忽视。

Anthropic 自己的文档建议用户从这个模型开始。它的成本只有两款顶级模型的一半,而在 OpenAI 公布的表格中,其 Artificial Analysis 智能指数达到 63.1,高于 Astra。

GPT-5.6 Terra 的价格为每百万输入 token 2 美元、每百万输出 token 12 美元。Luna 则低至 0.20 美元和 1.20 美元。

大量工作根本不需要前沿旗舰模型。大多数真实生产流量都属于这一类。

如果你的业务需要原生视频或音频输入,可以选择 Gemini 3.1 Pro,价格为每百万输入 token 2 美元、每百万输出 token 12 美元。Astra 目前完全不支持这两种输入形式。

更成熟的答案正日益趋向多模型路由。

当不同前沿模型之间的价格差超过十倍,而质量差距只有几个指数点时,坚持只用一个模型表面上像是技术架构选择,本质上却是预算决策。

最终思考

GPT-6 Astra 确实代表了进步,但这种进步集中在一个狭窄却极其重要的方向上,而 OpenAI 的营销已远远跑在目前可获得的测量结果之前。

它的智能体能力经得起初步审视:token 效率大幅提升,幻觉率下降约一半,计算机操作得分领先幅度大到无法完全归因于框架差异。

ARC Prize 发现,在 96% 的关卡中,Astra 完成任务所用的操作次数少于人类中位数。这可能是整个发布中最有趣的结果,也最值得继续关注。

如果你把耗时数小时、多步骤的复杂任务交给模型,那么这周你应该针对自己的工作负载运行上面列出的六项测试。

但所宣称的“通用智能飞跃”仍没有足够证据。

在现阶段,唯一独立的综合指数显示,Astra 与它所取代的 Sol 完全持平,同时落后于 Anthropic 的旗舰模型,而价格是 Sol 的 2.5 倍。

当然,这只是一家评估机构的一套测试,且是在模型发布一天后完成的。分数未来很可能会继续变化。

本文表达的观点和意见仅代表作者本人,并不一定反映AICompareNet的官方立场。信息仅供一般参考,可能并非最新内容。在基于此内容做出决策前,请独立核实详细信息。