GPT-6 Luna 评测
Luna 更值得先用于可重复、易验证的任务,低单价需要配合可靠的输出检查。
GPT-6 Luna 于 2026 年 9 月 22 日发布,面向明确、高频的工作。标准 API 每百万输入 $0.10、输出 $0.50,分别是 Sol 对应单价的二十分之一。我们的建议是先测试分类、提取和短文本转换,并在设计 prompt 时一并设计验收规则。
资料核验于 2026 年 9 月 23 日。 本文是基于 OpenAI 官方规格和可复算费用的发布评测,未运行两款模型的独立对照测试。下文选型建议是测试起点,不能当成已测得的准确率、速度或排名。
GPT-6 Luna 评测结论:适合谁用?
目前最明确的优势是价格。 Luna 同时保留文本和图片输入、推理控制、结构化输出与工具能力,可作为应用里重复执行步骤的候选模型。
适合优先验证的,是失败可以被发现和修正的任务,例如缺少发票字段、返回非法类别或 JSON 格式错误。如果错误会悄悄进入客户答案或代码,就不能只按 token 单价做决定。
GPT-6 Luna 参数与上下文窗口
| 项目 | GPT-6 Luna |
|---|---|
| API 模型 ID | gpt-6-luna |
| 发布时间 | 2026-09-22 |
| 上下文窗口(token) | 1,050,000 |
| 最大输入(token) | 922,000 |
| 最大输出(token) | 128,000 |
| 输入 / 输出 | 文本与图片 / 文本 |
| 推理强度 | none, low, medium, high, xhigh, max |
| 知识截止时间 | 2026-05-18 |
两款模型默认使用 medium 推理。105 万上下文是容量上限,最大输入为 922K token,输出预算还要容纳推理 token。相同上下文容量不代表相同的长文本召回率或编程能力。
GPT-6 Luna API 多少钱?
以下为 OpenAI 直连 API 的 Standard 价格,单位为美元 / 百万 token,不是 OmniaKey 网关报价。
| 计费项目 | 输入不超过 272K | 输入超过 272K |
|---|---|---|
| 未缓存输入 | $0.10 | $0.20 |
| 缓存读取 | $0.01 | $0.02 |
| 缓存写入 | $0.125 | $0.25 |
| 输出 | $0.50 | $0.75 |
输入超过 272K token 时,整个请求的输入与缓存费率变成 2 倍,输出费率变成 1.5 倍,并非只有超出部分加价。按当前文档表述,恰好 272K 仍属于低价档。
官方将 Batch、Flex 定为适用 Standard 费率的 50%,Fast mode 为 2 倍,符合条件的区域处理另加 10%。各处理模式有独立的可用条件;价格倍率不等于延迟保证。
用 Luna 处理 1,000 个任务多少钱?
| 假设工作量 | 模型 token 成本 |
|---|---|
| 100K 未缓存输入 + 10K 计费输出 | $0.015 |
| 300K 未缓存输入 + 10K 计费输出 | $0.0675 |
| 1,000 个任务,每个 10K 输入 + 1K 计费输出 | $1.50 |
单个任务如果使用 10K 输入和 1K 计费输出,计算为 0.01 × $0.10 + 0.001 × $0.50 = $0.0015,1,000 个同等任务在 Standard 下为 $1.50。按官方 Batch 五折费率,同样 token 量为 $0.75,仍需另计其它费用并满足 Batch 使用条件。这是明确工作量下的算例,不能假定每份文档都使用同样 token。
这些是算例,不是实际账单。计费输出包括推理 token 与可见文本;假设每个任务只运行一次、没有缓存写入或命中,未计工具、存储、税费与人工审核。复核实际调用时应读取 usage 数据。
GPT-6 Luna 性能如何?有哪些限制?
官方强调特定任务上的效率,没有由此保证某个准确率、每秒输出速度或与 Sol 相同的能力。我们没有运行第一手 Luna benchmark,因此用已公开的功能与成本分析判断适用性,不给出虚构成绩。
提取任务应分别统计遗漏、错误值和编造值,合法 JSON 不等于正确发票金额。分类任务要加入模糊输入和分布外样本。编程可以从局部转换和现有测试开始,再决定是否让 Luna 承担整个仓库的设计任务。
哪些工作适合先交给 Luna?
- 文档处理: 提取已定义字段,验证必填项、数值关系和原文出处,将无法确认的内容交给复核。
- 分类与分流: 限定标签集合,保留 unknown 分支,并检查误报率。格式正确不能替代语义判断。
- 局部编程: 小范围测试补充或机械修改应有可执行验收,解决不了时再升级模型。
低价模型如果反复调用工具或需要大量人工修复,仍然可能很贵。记录每次验收结果、限制重试次数,并抽查已通过的输出是否漏掉错误。Sol 与 Luna 对比给出了一个升级路线的预算算例。
API 接入与工具调用限制
两者都支持 Responses 和 Chat Completions。需要同时使用推理与工具时选 Responses API。模型页限定 Chat Completions 只有在 reasoning_effort=none 时支持 function calling,不能因两个端点都存在就假定工具行为完全相同。
Responses 的 reasoning.effort 支持 none、low、medium、high、xhigh、max。先固定档位测试,再依据验收结果增加推理预算。两者均支持结构化输出和图片输入;原生输出是文本,调用图片生成工具属于另一项操作。
curl --fail-with-body https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-luna",
"reasoning": {
"effort": "medium"
},
"input": "提取订单中的商品名称和数量,并返回 JSON 数组:3 本笔记本和 2 支笔。"
}'
本页请求示例与价格均以 OpenAI 直连为准。通过 OmniaKey 使用时,请在实时模型目录核对具体路线、功能和报价。OpenAI 发布模型不等于某个网关、Codex 客户端或 ChatGPT 套餐已经开放。
常见问题
GPT-6 Luna 的 API 价格是多少?
Standard 模式且输入不超过 272K 时,每百万 token 输入 $0.10、缓存读取 $0.01、缓存写入 $0.125、输出 $0.50。长输入按上方高价档计算。
GPT-6 Luna 能写代码吗?
它支持文本生成、推理和工具,可以用于编程评估。建议从带测试的小修改开始,价格与上下文容量并不能证明复杂跨文件任务的可靠性。
Luna 与 Sol 的上下文一样大吗?
一样。两者都列出 1,050,000 上下文、922,000 最大输入和 128,000 最大输出 token,但不代表长上下文准确率与速度一致。