GPT-6 Astra 评测:迁移前必须核对什么
GPT-6 Astra 是单一旗舰型号,不是新的 Sol/Terra/Luna 家族。本文把官方 API 事实、Codex 可用性和 OmniaKey 网关成本拆开核对,方便你用真实任务验证迁移。
GPT-6 Astra 适合需要最强端到端推理、编程、计算机操作、研究或文档处理能力的工作流。首先要纠正一个容易混淆的说法:Astra 是一个拥有单一 API ID 的旗舰型号 gpt-6-astra,不是像 GPT-5.6 那样由 Sol、Terra、Luna 组成的新家族。
实际选型可以这样开始:多步骤、跨文件、跨工具,而且错误代价高的任务,先用 Astra 建立质量基线;如果 GPT-5.6 Sol、Terra 或 Luna 已经以更低成本达到验收目标,就继续保留它们。模型版本号不是 benchmark,真正应比较的是同一代码库、同一工具权限、同一验收命令下的成功率、重试次数和人工修正时间。
事实核验日期:2026 年 9 月 4 日。 我逐项核对了 OpenAI 官方模型页、价格页、最新模型指南、模型选择指南和 Codex 模型页,并在同一天核对 OmniaKey 的实时 Astra 模型页。本文没有运行受控的独立 benchmark;服务商、账户和网关的可用性都可能在发布后变化。
先看结论
| 问题 | 已核对的答案 |
|---|---|
| API 模型 ID 是什么? | gpt-6-astra |
| 适合什么工作? | 最难的端到端推理、编程、计算机操作、研究和文档任务 |
| 上下文限制? | 1,050,000 Token;最大输入 922,000,最大输出 128,000 |
| 输入与输出模态? | 输入支持文本和图片;输出为文本 |
| 支持哪些 effort? | low、medium、high、xhigh、max;不支持 none |
| OpenAI Standard 价格? | 每百万 Token:输入 $10、缓存输入 $1、缓存写入 $12.50、输出 $50 |
| 超过 272K 输入会怎样? | 整个请求切换到长上下文费率,不只是超出的部分 |
| OmniaKey 是否有路由? | 实时目录列出 gpt-6-astra;网关价格与 OpenAI 直连价格分开计算 |
| Codex cloud 是否可选? | 当前 Codex 矩阵列出桌面端、网页、CLI 和 IDE,不列出 Codex cloud;还要看登录方式、套餐、灰度和客户端 |
Astra 是什么,不是什么
OpenAI 将 Astra 描述为面向最难端到端工作的最强模型,官方指南具体提到复杂推理、编程、浏览、计算机操作、软件工程、科学、专业工作和文档创建。这些是厂商定位,不是对每个仓库和每种语言的独立排名。
它与现有 GPT-5.6 文章的边界如下:
| 维度 | GPT-6 Astra | GPT-5.6 家族 |
|---|---|---|
| 目录形态 | 一个旗舰模型 | Sol、Terra、Luna 三档 |
| API ID | gpt-6-astra | gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna |
| 默认定位 | 最难的端到端工作 | Sol 难任务、Terra 平衡、Luna 成本敏感批量任务 |
| 直连 Standard 输入/输出 | $10 / $50 每 MTok | Sol $4 / $20,Terra $2 / $12,Luna $0.20 / $1.20 |
| 主要迁移风险 | 不支持的参数、推理下限、Responses 工具路径 | 家族路由、长上下文价格档和客户端支持差异 |
如果你要比较 Sol、Terra、Luna,请阅读 GPT-5.6 评测;本文只负责 Astra 路由以及迁移前必须验证的合同。
官方规格逐项核对
以下数字来自 OpenAI GPT-6 Astra 官方模型页。它们是模型上限,不代表每个 SDK、网关或 Agent 都会暴露完整能力。
| 规格 | GPT-6 Astra |
|---|---|
| 模型 ID / 默认 Snapshot | gpt-6-astra |
| 上下文窗口 | 1,050,000 Token |
| 最大输入 | 922,000 Token |
| 最大输出 | 128,000 Token |
| 知识截止日期 | 2026-04-30 |
| 输入模态 | 文本、图片 |
| 输出模态 | 文本 |
| 推理 | 支持 low、medium、high、xhigh、max |
| Fine-tuning | 不支持 |
| Streaming / Structured Outputs | 支持 |
| Function calling / Prompt caching | 支持 |
上下文窗口包含渲染后的 Prompt、对话历史、工具定义、检索文件、图片、推理 Token 和输出 Token。数字上能塞进一百万 Token,不等于把整个仓库无筛选地塞进去就会更好。应先检索、压缩和排序证据,再给输出和推理留空间。
Endpoint 与工具边界
OpenAI 同时列出 Chat Completions 和 Responses。可是最新模型迁移指南补充了关键限制:Astra 可以接收 Chat Completions,但工具调用要求使用 Responses API。新 Agent 工作流应从 /v1/responses 开始,并验证网关是否暴露相同的工具面。
| 能力 | 当前状态 |
|---|---|
| Chat Completions | 支持 |
| Responses | 支持,也是官方建议的工具路径 |
| Batch | 支持 |
| Realtime、实时翻译、实时转写 | 不支持 |
| Assistants、旧版 Completions | 不支持 |
| Fine-tuning、Embeddings、Moderation | 不支持 |
| 图片生成、视频、语音、转写、翻译 | 不是 Astra 的可用端点 |
Responses 工具列表包括 web search、file search、image generation、code interpreter、hosted shell、Apply Patch、skills、computer use、MCP 和 tool search。模型能发出工具调用,不等于应用可以无条件执行:你的 Agent 仍负责权限、沙箱、参数校验、超时、回传结果和副作用审批。
官方最新指南还记录了异步工具调用、WebSocket 中途转向、用 configuration_update 在多轮中改变 effort,以及异步 misalignment monitoring。这些是工作流能力,不是替代审批、审计和回滚的理由。
推理控制:迁移时最容易漏掉的差异
Astra 不支持 none。如果旧客户端发送 none 或旧式 minimal,先改成 low,再在同一验收集上比较 medium 和 high:
low
medium
high
xhigh
max
用能通过验收的最低档位。max 会给模型更多推理空间,也可能增加延迟和计费输出 Token,但不保证正确。OpenAI 的模型选择指南建议先保证准确率,再用更小模型或更低 effort 优化成本和延迟。
推理 Token 不会出现在最终文本里,却会占用上下文并按输出 Token 计费。如果 max_output_tokens 太小,响应可能在推理阶段就变成 incomplete,还没有可见答案。请检查 output_tokens_details.reasoning_tokens,为复杂任务预留足够的输出预算。
OpenAI 官方 API 价格
以下均为每百万 Token(MTok)的美元价格,来自 OpenAI 价格页。普通输入、缓存输入、缓存写入和输出是不同计费桶。
| 处理模式 | 输入 | 缓存输入 | 缓存写入 | 输出 |
|---|---|---|---|---|
| Standard,输入不超过 272K | $10.00 | $1.00 | $12.50 | $50.00 |
| Standard,输入超过 272K | $20.00 | $2.00 | $25.00 | $75.00 |
| Batch 或 Flex,不超过 272K | $5.00 | $0.50 | $6.25 | $25.00 |
| Batch 或 Flex,超过 272K | $10.00 | $1.00 | $12.50 | $37.50 |
| Fast,不超过 272K | $20.00 | $2.00 | $25.00 | $100.00 |
| Fast,超过 272K | $40.00 | $4.00 | $50.00 | $150.00 |
缓存写入是普通输入费率的 1.25 倍;Batch 和 Flex 是 Standard 的 50%;Fast 是适用费率的 2 倍。OpenAI 还注明 Astra 在 EU data residency 下不可用 Fast,区域处理可能另加 10%。预算前应重新打开价格页。
272K 规则到底怎么计费?
一旦输入超过 272,000 Token,OpenAI 会把整个请求按长上下文费率计算,而不是前 272K 走低价、剩余部分走高价。
| 请求 | 短上下文算法 | 长上下文算法 |
|---|---|---|
| 100K 输入 + 10K 输出 | 0.1 × $10 + 0.01 × $50 = $1.50 | 不适用 |
| 300K 输入 + 10K 输出 | 不适用 | 0.3 × $20 + 0.01 × $75 = $6.75 |
这是 OpenAI Standard 的 Token 算术,不含工具、重试、区域处理、税费和人工时间。虽然第二个请求只有 28K 超过阈值,整次仍按 $6.75 计算。
OmniaKey 网关价格
OmniaKey 当前实时页列出准确的 gpt-6-astra 路由。它是网关自己的报价,不是 OpenAI 发票:
| OmniaKey 统一费率 | 输入 | Cache hit | 输出 |
|---|---|---|---|
| 整个标注的上下文窗口 | $0.70 / MTok | $0.07 / MTok | $3.50 / MTok |
同样的两个 Token 示例,在 OmniaKey 中分别约为:
| 请求 | 计算 | 估算 |
|---|---|---|
| 100K 输入 + 10K 输出 | 0.1 × $0.70 + 0.01 × $3.50 | $0.105 |
| 300K 输入 + 10K 输出 | 0.3 × $0.70 + 0.01 × $3.50 | $0.245 |
网关价格、账户权限、故障切换和 usage 记录属于 OmniaKey。Astra 在 OmniaKey 的整个标注上下文窗口都采用这一档低价,不会因为输入更长而增加第二档网关费率。请在生产预算前查看 Astra 实时模型页 和 模型目录,不要把网关行抄到“OpenAI 官方价格”表里。
Prompt caching:最值得测的成本杠杆
OpenAI 对支持的模型默认启用 Prompt caching。针对 GPT-6 Astra 和 GPT-5.6 以后型号,当前文档给出这些规则:
- 可缓存的可见前缀至少 1,024 Token;
- cache write 是普通输入价格的 1.25 倍;
- cache read 是普通输入价格的 0.1 倍;
- 使用
prompt_cache_options.ttl,当前支持的默认值是30m; - 可以用显式 breakpoint 避免把变化频繁的后缀写进缓存;
prompt_cache_key只能帮助相似流量命中同一缓存,不能保证命中。
按 Astra Standard 短上下文价格,一个 100,000 Token 的前缀写入一次并读取一次,成本是 0.1 × $12.50 + 0.1 × $1.00 = $1.35;两次都不缓存则是 2 × 0.1 × $10.00 = $2.00。只有渲染后的前缀、工具定义和相关设置稳定时才成立。请记录 cached_tokens、cache write、延迟和实际账单,不要因为两个 Prompt 看起来相似就假设命中。
从旧型号迁移时,把旧的 prompt_cache_retention 改为 prompt_cache_options.ttl: "30m"。Astra 还可以通过多轮中的 configuration_update 改变 effort,同时不重写原始前缀,有助于保持缓存复用。
从 GPT-5.6 迁移的核对清单
1. 固定精确模型 ID
{
"model": "gpt-6-astra"
}
把 ID 放进配置和评测日志。官方当前的 default snapshot 也是这个值,记录它便于之后审计。
2. 工具工作流改用 Responses
curl https://api.omniakey.com/v1/responses \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": "检查这份 migration 计划,列出两个风险和对应验收测试。"
}'
Chat Completions 仍可用于文本请求,但官方迁移指南明确说工具调用需要 Responses。启用 hosted shell、computer use 或 MCP 前,先验证网关和 SDK 的具体暴露范围。
3. 移除不支持的采样参数
官方迁移指南要求移除 temperature、top_p、top_logprobs;Chat Completions 还要移除 logprobs,Responses 则移除 message.output_text.logprobs。不要把它们静默翻译成另一个控制后就声称行为等价。
4. 替换 none / minimal
先用 low 跑旧任务,再用 medium、high 对照。记录模型 ID、effort、输入 Token、推理 Token、可见输出、延迟、重试和人工修正分钟数。
5. 重新检查缓存
使用 prompt_cache_options.ttl: "30m",保持稳定前缀;动态内容不值得写缓存时使用显式 breakpoint,并比较迁移前后的真实 cache read。
6. 重跑异常与权限测试
覆盖 max_output_tokens 不够、工具参数校验、拒绝副作用、取消、流式终止和供应商错误。HTTP 200 只代表传输完成,不代表业务结果已经通过验收。
Codex 与客户端可用性
当前官方 Codex 模型页把 Astra 列在 ChatGPT 桌面端、ChatGPT 网页、Codex CLI 和 Codex IDE extension,并列出 API Access 与 ChatGPT Credits;在当前矩阵中没有列 Codex cloud。官方同时说明,可用性取决于灰度、登录方式、套餐、工作区策略和客户端版本。
所以要分开回答两个问题:
- API key 能否通过 Responses 调用
gpt-6-astra? - 某个 Codex 入口是否允许当前认证方式选择 Astra?
第一个通过,不代表第二个也通过。OmniaKey 当前目录把 Astra 标为 Codex、Cursor、Cline、Aider 兼容;请使用目录显示的精确 ID 和客户端自己的 custom provider 配置。要分层诊断模型、API、Codex,可以参考 兼容性工具包,它虽然针对 GPT-5.6 编写,但“直连检查和客户端检查分开”的方法仍然适用。
可复现的 Astra 评测方案
OpenAI 的模型选择指南建议先用最强模型建立准确率目标,再优化成本和延迟。可以从真实工作中抽取五类任务:
- 有确定性测试的日常功能。
- 根因跨越至少两个模块的可复现 Bug。
- 必须遵守权限的工具密集任务。
- 需要检索质量的长上下文任务。
- 需要来源核对的研究或文档任务。
固定起始 commit、系统指令、工具、权限、模型 ID、effort 和验收命令。每次记录:
是否通过 / 首次是否验收
输入与缓存 Token
推理与可见输出 Token
延迟与首 Token 时间
工具调用与被拒调用
重试次数与供应商错误
人工修正分钟数
直连或网关实际成本
只有 Astra 基线通过后,才拿它与 GPT-5.6 Sol、Terra、Luna 比较。更便宜的模型只有在结果等价且完整任务成本下降时才算胜出。
限制与常见误区
“1M 上下文”不是免费额度
工具 schema、历史、检索文件、图片、推理和输出都会占窗口。完整仓库即使没超过数字上限,也可能带来注意力噪声和更高账单。
“最强”不是独立 benchmark 结论
OpenAI 的定位和厂商评测是一手证据,不等于在你的仓库、语言、工具和安全策略上必胜。请使用同一验收集重测。
API 可用不等于 Codex cloud 可用
API 模型页和 Codex 选择器回答的是不同的权限问题。先核对认证方式和当前客户端矩阵,再修改生产默认值。
支持工具不等于允许执行
Responses 可以发出工具调用,但授权、沙箱、超时、参数校验、副作用审批和审计日志仍由你的系统负责。
超过 272K 会改变整张账单
超过阈值后整个请求重算长上下文价格。先压缩日志、筛选文件,再添加上下文。
最终结论
GPT-6 Astra 值得作为最难端到端工作流的第一测试对象:持续推理、跨模块编程、计算机操作、研究和文档任务。它的官方 Token 价格明显高于 GPT-5.6 三档,因此是否值得采用,取决于失败尝试、重试和人工修正是否减少,而不是只看每 Token 单价。
固定 gpt-6-astra,从 low 或 medium effort 开始,工具使用 Responses;如果按 OpenAI 直连价格预算,尽量把输入控制在 272K 以下。通过 OmniaKey 时,整个标注上下文窗口都采用同一档低价,并应验证具体客户端路由。当 GPT-5.6 档位的完整任务成本更低且验收结果等价时,继续路由到它们是理性的工程决策。
常见问题
GPT-6 Astra 会替代 GPT-5.6 Sol 吗?
它是更新的旗舰路由,但不代表必须全量替换。Astra 面向最难端到端工作,Sol 仍是价格更低的前沿选项。请在同一验收集上比较重试和人工时间。
GPT-6 Astra 的精确模型 ID 是什么?
使用 gpt-6-astra。官方当前 default snapshot 也是这个值,评测和生产配置都应固定它。
Astra 官方价格是多少?
Standard 短上下文是输入 $10、缓存输入 $1、缓存写入 $12.50、输出 $50/百万 Token。超过 272K 后整次请求变为输入 $20、缓存输入 $2、缓存写入 $25、输出 $75。
Astra 支持图片吗?
支持图片输入,输出是文本;官方没有把音频或视频输入输出列为 Astra 模态。
Astra 能在 Chat Completions 里调用工具吗?
官方列出 Chat Completions 端点,但最新迁移指南说工具调用需要 Responses。工具工作流使用 /v1/responses,并验证网关实际支持。
Astra 在 Codex cloud 可用吗?
当前 Codex 矩阵列出桌面端、网页、CLI 和 IDE extension,没有列出 Codex cloud。账户、登录方式、工作区策略和客户端会影响结果。
应该选哪个 reasoning effort?
从 low 或 medium 开始,只有验收测试显示规划或检查不足时才提高。Astra 不支持 none;更高 effort 增加工作量和成本,也不保证正确。
Astra 在 OmniaKey 上多少钱?
实时页当前列出输入 $0.70、缓存命中 $0.07、输出 $3.50/百万 Token,整个标注的上下文窗口都使用这一档低价,不会因输入超过 272K 而增加第二档。预算前重新查看实时目录。