Jev 模型已集成上线 · 欢迎使用
博客
成本控制

Gemini 3.8 Flash API 价格与 Agent 任务成本

Google 当前 Standard 费率为每百万输入 $0.75、输出 $3.75;OmniaKey 当前为 $0.45 与 $2.25,但真正该预算的是每个通过验收的任务成本。

11 分钟阅读OmniaKey
Gemini 3.8 FlashAPI 价格Agent 成本thinking token成本控制

Gemini 3.8 Flash API 价格在 Google 付费 Standard API 上为每百万输入 token $0.75、每百万输出 token $3.75,有效期至 2026 年 12 月 31 日。Google 公布的 2027 年 1 月 1 日起费率为输入 $1.50、输出 $7.50OmniaKey 模型页当前独立报价为输入 $0.45、输出 $2.25、缓存读取 $0.045

上述直连数字与日期来自 Google 实时 Gemini API 价格表

这些数字只能说明一个 token 桶多少钱。Agent 预算真正需要的是:所有成功与失败尝试的总支出,除以通过验收的任务数。一次便宜但连续失败的调用,完全可能比一次较贵但直接通过的调用更贵。

事实核验日期:2026 年 9 月 20 日。 Google 的价格、日期、token 上限、thinking 等级、缓存与 Batch 行为均来自当前官方文档;OmniaKey 数字来自实时目录,是另一份独立网关报价。本文是基于资料的成本分析,没有运行第一手 benchmark 或产生账单的生产测试,也不声称该模型具有某个成功率。

Gemini 3.8 Flash API 价格速览

下表单位均为美元/百万 token。“缓存输入”指较低的缓存读取费率,不包含 Google 另行收取的缓存存储费。

计费路径输入缓存输入输出(含 thinking)适用范围
Google Standard,至 2026-12-31$0.75$0.075$3.75Gemini API 直连付费档
Google Batch 或 Flex,至 2026-12-31$0.375$0.0375$1.875直连且允许延迟或弹性处理的任务
Google Priority,至 2026-12-31$1.35$0.135$6.75直连优先处理
Google Standard,自 2027-01-01$1.50$0.15$7.50已公布的直连 Standard 费率
OmniaKey 当前目录$0.45$0.045$2.25当前网关 Standard 报价

OmniaKey 当前报价比 Google 当前 Standard token 费率低 40%,但这不代表 2027 年之后仍会固定为 Google 的 60%。两家公司分别维护自己的价格。批准生产预算前,应重新查看实时价格表

Google 当前 Batch 与 Flex 单价低于 OmniaKey Standard 报价,但两者不是同一种服务。Batch 是异步任务,目标周转时间为 24 小时,而且 Google 文档将其归于 generateContent。网关没有明确说明时,不要假设它也提供 Google 的 Batch、Flex 或 Priority 模式。

缓存存储、Grounding、外部工具、浏览器、数据库、托管、税费与人工复核,也可能产生 token 表中没有的费用。

如何计算每个通过验收的 Agent 任务成本

先确定实际调用路径,再套公式:

text
每次尝试的模型成本
  = 输入百万数 x 输入费率
  + 缓存输入百万数 x 缓存费率
  + 输出百万数 x 输出费率

每次尝试的总成本
  = 模型成本 + 工具 + Grounding + 基础设施 + 人工复核

实测每个通过验收任务的成本
  = 成功与失败尝试的全部支出
  / 通过验收的任务数

若每次尝试成本近似相同,且每次通过可近似看作独立事件,可用:

text
预计每个通过验收任务的成本 = 每次尝试成本 / 通过率

最后一条只是预测捷径。失败任务可能提前终止,也可能循环更久、调用更多工具或进入人工修复。上线后应使用真实总支出作为分子。

测试前先定义“通过”:代码补丁通过单元测试、JSON 通过 schema 校验、抽取结果匹配人工标注,或客服答案通过评分标准。HTTP 200 本身不是验收条件。

可复算示例:20K 输入、5K 输出、70% 通过率

假设每次完整尝试消耗 20,000 个未缓存输入 token 和 5,000 个输出 token;输出中已经包含供应商计费的 thinking token。为保证公式可复算,暂不计工具、缓存存储、税费和人工复核。

计费路径每次尝试成本70% 通过率下的预计通过任务成本
Google Standard(2026 年内)0.02 x $0.75 + 0.005 x $3.75 = $0.03375$0.0482
Google Standard(2027 年起)0.02 x $1.50 + 0.005 x $7.50 = $0.06750$0.0964
Google Batch/Flex(2026 年内)0.02 x $0.375 + 0.005 x $1.875 = $0.016875$0.0241
OmniaKey 当前目录0.02 x $0.45 + 0.005 x $2.25 = $0.02025$0.0289

在 token 用量不变的前提下,Google 直连 Standard 在 2027 年 1 月 1 日后成本翻倍。OmniaKey 这一行只使用当前目录价,绝不是未来价格预测。Batch/Flex 一行也说明:比较 API 成本时必须注明消费模式,允许延迟的直连任务可能比交互式网关请求更便宜。

按当前 Google Standard 费率,同一笔 $0.03375 的尝试在 90% 通过率下为每个通过任务 $0.0375,在 70% 时为 $0.0482,在 50% 时为 $0.0675。提升通过率可能比缩短一个小 prompt 更重要。

Thinking token 可能主导输出账单

Google 为 gemini-3.8-flash 提供 lowmediumhigh 三档 thinking,默认是 mediumminimal 不受支持,会直接报错。输出费同时覆盖可见回答 token 与 thinking token。

官方模型页列出的输入上限为 1,048,576 token,输出上限为 65,536 token。它们是容量上限,不是免费额度;实际计费 token 仍需进入任务成本的分子。

因此需要注意:

  1. 可见回答很短,也可能因为内部推理较长而产生较高输出费。
  2. max_output_tokens 设得太小,可能在推理中途截断,得到不完整甚至空结果,同时已经生成的 thinking token 仍会计费。
  3. 只有当 high 带来的通过率增益足以覆盖额外输出与延迟,它才更经济。

应在同一任务集上测试 lowmediumhigh,固定 prompt、工具、权限、重试策略和验收命令。选择能达到目标通过率的最低档,而不是仅仅“能返回文本”的最低档。

缓存、重试和工具必须放进同一本账

Google 为 Gemini 3.8 Flash 的隐式缓存列出 4,096 token 的最低合格前缀。若客户端能保持前缀不变,把稳定的 system 指令与工具 schema 放在变化任务数据之前,并核对供应商报告的缓存用量。文本相似不等于缓存命中。

重试应记录原因:传输错误、工具参数无效、验收失败、人工要求返工应分开统计。无限重试会让通过率看起来更好,却在后台持续扩大分子。

工具型 Agent 至少要记录:

  • 请求与返回的模型 ID;
  • 当前协议实际提供的输入、缓存输入、thinking 与可见输出用量;
  • 工具名称、工具费用与轮次数;
  • 延迟、错误类别与重试次数;
  • 验收结果及产生该结果的具体检查;
  • 该路径的最终账单金额。

Gemini 原生协议与 OpenAI 兼容协议的 usage 字段名可能不同。应把真实路径返回的字段与 OmniaKey 用量面板对账,不要套用另一家供应商的 schema。

Google 直连与 OmniaKey 怎么选

需求优先测试原因
可延迟批量任务的最低公开单价Google Batch当前直连 Batch 为 Standard 的 50%,但属于异步任务
Google 专属 Grounding 或消费模式Google 直连这些能力由 Google 直连合同明确描述
一把 Key 与 OpenAI 兼容接口OmniaKey当前目录用独立网关报价提供 gemini-3.8-flash
严格延迟要求的交互式 Agent两边实测token 单价不能证明排队、可靠性或通过率
2027-01-01 之后的生产路径两边重查Google 已计划调价,未来网关价格仍未知

这不是“谁永远更好”的排名。数据政策、地区可用性、速率限制、支持、路由透明度与客户端协议都可能改变决定。

通过 OmniaKey 调用 Gemini 3.8 Flash

先在实时模型目录确认 gemini-3.8-flash,再在API Key 页面创建独立凭据,然后调用 OpenAI 兼容接口:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
    ],
    "stream": true
  }'

API 快速入门说明鉴权与 Base URL。真实 Key 只能放在环境变量中,不能写进源码、prompt、benchmark 日志或截图。

常见问题

Gemini 3.8 Flash API 多少钱?

Google 付费 Standard 在 2026 年 12 月 31 日前为每百万输入 $0.75、输出 $3.75;2027 年 1 月 1 日起列出的费率为 $1.50 与 $7.50。OmniaKey 当前独立网关报价为输入 $0.45、输出 $2.25。

Thinking token 算输出费吗?

算。Google 明确说明输出价格包含 thinking token。预算应依据供应商 usage,而不是肉眼可见的回答长度。

OmniaKey 是否永远比 Google 直连便宜?

不是。OmniaKey 当前 Standard 报价低于 Google 当前 Standard;但符合条件的 Google Batch 与 Flex 当前更低。可用性、延迟、协议与未来价格也必须分开比较。

为什么要除以通过率?

失败尝试会花钱,却不会增加通过验收的任务数。每次尝试成本稳定时,除以通过概率可以估算一个通过任务背后的支出;有生产数据后,应改用真实总支出除以通过任务数。

Agent 应该用哪个 thinking 等级?

边界清晰、可自动检查的任务先测 low;失败代价高时再测试 mediumhigh。Gemini 3.8 Flash 不支持 minimal。正确选择是能稳定通过同一验收门槛的最低成本档。

一手资料

证据与计算核验于 2026 年 9 月 20 日。价格、模型限制、路径可用性与供应商行为都可能变化;正式投入生产预算前,请重新查看一手费率表与 OmniaKey 实时目录。