Gemini 3.8 Flash API 价格与 Agent 任务成本
Google 当前 Standard 费率为每百万输入 $0.75、输出 $3.75;OmniaKey 当前为 $0.45 与 $2.25,但真正该预算的是每个通过验收的任务成本。
Gemini 3.8 Flash API 价格在 Google 付费 Standard API 上为每百万输入 token $0.75、每百万输出 token $3.75,有效期至 2026 年 12 月 31 日。Google 公布的 2027 年 1 月 1 日起费率为输入 $1.50、输出 $7.50。OmniaKey 模型页当前独立报价为输入 $0.45、输出 $2.25、缓存读取 $0.045。
上述直连数字与日期来自 Google 实时 Gemini API 价格表。
这些数字只能说明一个 token 桶多少钱。Agent 预算真正需要的是:所有成功与失败尝试的总支出,除以通过验收的任务数。一次便宜但连续失败的调用,完全可能比一次较贵但直接通过的调用更贵。
事实核验日期:2026 年 9 月 20 日。 Google 的价格、日期、token 上限、thinking 等级、缓存与 Batch 行为均来自当前官方文档;OmniaKey 数字来自实时目录,是另一份独立网关报价。本文是基于资料的成本分析,没有运行第一手 benchmark 或产生账单的生产测试,也不声称该模型具有某个成功率。
Gemini 3.8 Flash API 价格速览
下表单位均为美元/百万 token。“缓存输入”指较低的缓存读取费率,不包含 Google 另行收取的缓存存储费。
| 计费路径 | 输入 | 缓存输入 | 输出(含 thinking) | 适用范围 |
|---|---|---|---|---|
| Google Standard,至 2026-12-31 | $0.75 | $0.075 | $3.75 | Gemini API 直连付费档 |
| Google Batch 或 Flex,至 2026-12-31 | $0.375 | $0.0375 | $1.875 | 直连且允许延迟或弹性处理的任务 |
| Google Priority,至 2026-12-31 | $1.35 | $0.135 | $6.75 | 直连优先处理 |
| Google Standard,自 2027-01-01 | $1.50 | $0.15 | $7.50 | 已公布的直连 Standard 费率 |
| OmniaKey 当前目录 | $0.45 | $0.045 | $2.25 | 当前网关 Standard 报价 |
OmniaKey 当前报价比 Google 当前 Standard token 费率低 40%,但这不代表 2027 年之后仍会固定为 Google 的 60%。两家公司分别维护自己的价格。批准生产预算前,应重新查看实时价格表。
Google 当前 Batch 与 Flex 单价低于 OmniaKey Standard 报价,但两者不是同一种服务。Batch 是异步任务,目标周转时间为 24 小时,而且 Google 文档将其归于 generateContent。网关没有明确说明时,不要假设它也提供 Google 的 Batch、Flex 或 Priority 模式。
缓存存储、Grounding、外部工具、浏览器、数据库、托管、税费与人工复核,也可能产生 token 表中没有的费用。
如何计算每个通过验收的 Agent 任务成本
先确定实际调用路径,再套公式:
每次尝试的模型成本
= 输入百万数 x 输入费率
+ 缓存输入百万数 x 缓存费率
+ 输出百万数 x 输出费率
每次尝试的总成本
= 模型成本 + 工具 + Grounding + 基础设施 + 人工复核
实测每个通过验收任务的成本
= 成功与失败尝试的全部支出
/ 通过验收的任务数
若每次尝试成本近似相同,且每次通过可近似看作独立事件,可用:
预计每个通过验收任务的成本 = 每次尝试成本 / 通过率
最后一条只是预测捷径。失败任务可能提前终止,也可能循环更久、调用更多工具或进入人工修复。上线后应使用真实总支出作为分子。
测试前先定义“通过”:代码补丁通过单元测试、JSON 通过 schema 校验、抽取结果匹配人工标注,或客服答案通过评分标准。HTTP 200 本身不是验收条件。
可复算示例:20K 输入、5K 输出、70% 通过率
假设每次完整尝试消耗 20,000 个未缓存输入 token 和 5,000 个输出 token;输出中已经包含供应商计费的 thinking token。为保证公式可复算,暂不计工具、缓存存储、税费和人工复核。
| 计费路径 | 每次尝试成本 | 70% 通过率下的预计通过任务成本 |
|---|---|---|
| Google Standard(2026 年内) | 0.02 x $0.75 + 0.005 x $3.75 = $0.03375 | $0.0482 |
| Google Standard(2027 年起) | 0.02 x $1.50 + 0.005 x $7.50 = $0.06750 | $0.0964 |
| Google Batch/Flex(2026 年内) | 0.02 x $0.375 + 0.005 x $1.875 = $0.016875 | $0.0241 |
| OmniaKey 当前目录 | 0.02 x $0.45 + 0.005 x $2.25 = $0.02025 | $0.0289 |
在 token 用量不变的前提下,Google 直连 Standard 在 2027 年 1 月 1 日后成本翻倍。OmniaKey 这一行只使用当前目录价,绝不是未来价格预测。Batch/Flex 一行也说明:比较 API 成本时必须注明消费模式,允许延迟的直连任务可能比交互式网关请求更便宜。
按当前 Google Standard 费率,同一笔 $0.03375 的尝试在 90% 通过率下为每个通过任务 $0.0375,在 70% 时为 $0.0482,在 50% 时为 $0.0675。提升通过率可能比缩短一个小 prompt 更重要。
Thinking token 可能主导输出账单
Google 为 gemini-3.8-flash 提供 low、medium、high 三档 thinking,默认是 medium;minimal 不受支持,会直接报错。输出费同时覆盖可见回答 token 与 thinking token。
官方模型页列出的输入上限为 1,048,576 token,输出上限为 65,536 token。它们是容量上限,不是免费额度;实际计费 token 仍需进入任务成本的分子。
因此需要注意:
- 可见回答很短,也可能因为内部推理较长而产生较高输出费。
max_output_tokens设得太小,可能在推理中途截断,得到不完整甚至空结果,同时已经生成的 thinking token 仍会计费。- 只有当
high带来的通过率增益足以覆盖额外输出与延迟,它才更经济。
应在同一任务集上测试 low、medium 与 high,固定 prompt、工具、权限、重试策略和验收命令。选择能达到目标通过率的最低档,而不是仅仅“能返回文本”的最低档。
缓存、重试和工具必须放进同一本账
Google 为 Gemini 3.8 Flash 的隐式缓存列出 4,096 token 的最低合格前缀。若客户端能保持前缀不变,把稳定的 system 指令与工具 schema 放在变化任务数据之前,并核对供应商报告的缓存用量。文本相似不等于缓存命中。
重试应记录原因:传输错误、工具参数无效、验收失败、人工要求返工应分开统计。无限重试会让通过率看起来更好,却在后台持续扩大分子。
工具型 Agent 至少要记录:
- 请求与返回的模型 ID;
- 当前协议实际提供的输入、缓存输入、thinking 与可见输出用量;
- 工具名称、工具费用与轮次数;
- 延迟、错误类别与重试次数;
- 验收结果及产生该结果的具体检查;
- 该路径的最终账单金额。
Gemini 原生协议与 OpenAI 兼容协议的 usage 字段名可能不同。应把真实路径返回的字段与 OmniaKey 用量面板对账,不要套用另一家供应商的 schema。
Google 直连与 OmniaKey 怎么选
| 需求 | 优先测试 | 原因 |
|---|---|---|
| 可延迟批量任务的最低公开单价 | Google Batch | 当前直连 Batch 为 Standard 的 50%,但属于异步任务 |
| Google 专属 Grounding 或消费模式 | Google 直连 | 这些能力由 Google 直连合同明确描述 |
| 一把 Key 与 OpenAI 兼容接口 | OmniaKey | 当前目录用独立网关报价提供 gemini-3.8-flash |
| 严格延迟要求的交互式 Agent | 两边实测 | token 单价不能证明排队、可靠性或通过率 |
| 2027-01-01 之后的生产路径 | 两边重查 | Google 已计划调价,未来网关价格仍未知 |
这不是“谁永远更好”的排名。数据政策、地区可用性、速率限制、支持、路由透明度与客户端协议都可能改变决定。
通过 OmniaKey 调用 Gemini 3.8 Flash
先在实时模型目录确认 gemini-3.8-flash,再在API Key 页面创建独立凭据,然后调用 OpenAI 兼容接口:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"messages": [
{"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
],
"stream": true
}'
API 快速入门说明鉴权与 Base URL。真实 Key 只能放在环境变量中,不能写进源码、prompt、benchmark 日志或截图。
常见问题
Gemini 3.8 Flash API 多少钱?
Google 付费 Standard 在 2026 年 12 月 31 日前为每百万输入 $0.75、输出 $3.75;2027 年 1 月 1 日起列出的费率为 $1.50 与 $7.50。OmniaKey 当前独立网关报价为输入 $0.45、输出 $2.25。
Thinking token 算输出费吗?
算。Google 明确说明输出价格包含 thinking token。预算应依据供应商 usage,而不是肉眼可见的回答长度。
OmniaKey 是否永远比 Google 直连便宜?
不是。OmniaKey 当前 Standard 报价低于 Google 当前 Standard;但符合条件的 Google Batch 与 Flex 当前更低。可用性、延迟、协议与未来价格也必须分开比较。
为什么要除以通过率?
失败尝试会花钱,却不会增加通过验收的任务数。每次尝试成本稳定时,除以通过概率可以估算一个通过任务背后的支出;有生产数据后,应改用真实总支出除以通过任务数。
Agent 应该用哪个 thinking 等级?
边界清晰、可自动检查的任务先测 low;失败代价高时再测试 medium 与 high。Gemini 3.8 Flash 不支持 minimal。正确选择是能稳定通过同一验收门槛的最低成本档。
一手资料
- Google Gemini API 价格(英文)
- Google Gemini 3.8 Flash 模型文档(英文)
- Google thinking 文档(英文)
- Google 上下文缓存文档(英文)
- Google Batch API 文档(英文)
证据与计算核验于 2026 年 9 月 20 日。价格、模型限制、路径可用性与供应商行为都可能变化;正式投入生产预算前,请重新查看一手费率表与 OmniaKey 实时目录。