GPT-6 Sol、Claude Opus 5.5 已上线GPT-6 Sol 价格仅为 5.6 Sol 的一半
博客
指南

Gemini 4 Argon 评测:发布很强,但公开 API 还没到

Argon 看起来是一次重要的前沿模型升级,但发布当天不宜直接迁移生产流量,应先核对证据并等待可调用的正式合同。

13 分钟阅读OmniaKey
Gemini 4 ArgonGemini 4模型评测API 价格网络安全

Gemini 4 Argon 是 Google Gemini 4 代际的首个前沿模型。 Google 在 2026-09-30 宣布了它,定位是长程软件工程、企业知识工作和防御性网络安全。模型确实已经发布,但访问是分阶段的:先通过 Fairwind Program 提供给可信的网络防御者,然后才扩展到付费 API 客户和 Google AI Ultra 订阅者。

因此本文是发布评测,不是我们亲自跑出的 API benchmark。Google 报告了 DeepSWE、AutomationBench、LVBench 和安全评估中的强劲结果。Artificial Analysis 已有早期独立快照,但速度面板尚未完整。我们没有使用 Gemini 凭据或运行付费请求;核对时 Argon 也不在 OmniaKey 公开目录中。

事实核对日期:2026-10-01。 下文的发布事实和厂商跑分来自 Google 公告及安全材料,独立数据会单独标注。Google 尚未发布稳定的公开 model ID、完整 endpoint 合同、SDK 迁移指南或全面可用日期,因此本文不虚构请求示例,也不声称已经可以用于生产。

先给结论

问题截至 2026-10-01 的核实答案
发布了什么Gemini 4 Argon,面向编程、企业知识工作和网络防御的前沿模型。
今天所有人都能调用吗不能。先向可信防御者开放,再扩展到付费 API 客户和 Google AI Ultra 订阅者。
API model ID 是什么产品名已经公布,但发布材料没有给出稳定的公开 API ID。不要猜 gemini-4-argon。
上下文或输出上限是多少Google 表示输出 token 上限为 1M,高于此前 Gemini 的 64K;最终输入合同仍待发布。
首发价格是多少输入每 1M token $2,输出 $10;缓存输入在此基础上便宜 95%。
首发期之后呢Google 表示之后为输入 $4、输出 $20 / 1M token。
有可复现的公开 benchmark 吗Google 公布了厂商结果,Artificial Analysis 给出早期 Intelligence Index 53。我们没有运行第一手付费 benchmark。
OmniaKey 已经路由 Argon 吗核对当天不在 OmniaKey 公开目录中。准备网关迁移前先查实时目录。

一句话判断是:有潜力,但还没有准备好在未经测试的情况下切生产。账号可以调用后,值得放到评测队列最前面;在那之前可用 Gemini 3.8 Flash 等已通过验收的线路作为基线。

Google 公布了什么

Google 将 Argon 称为新的前沿模型,并表示它已经用于内部工作流。首批外部用户是 Fairwind Program 中的可信网络防御者。Google 计划“尽快”向开发者、企业和消费者扩展,首批一般客户是付费 API 客户与 Google AI Ultra 订阅者。

公告能证明模型已经存在,但不能证明每个 Google AI Studio 项目、地区、SDK、网关或账号都能调用。此前的 Gemini 4 状态指南 正确地区分了“已命名的训练项目”和“可调用的 API 模型”。这次发布让 Argon 进入“已公布产品”阶段,但全面 API 可用性仍要单独核查。

能力画像

能力已公布内容应该如何理解
长程推理面向复杂、多步骤流程的深度推理是目标场景,不代表所有长 prompt 都有效。
软件工程Google 报告 DeepSWE v1.1 为 77.9%特定 harness 和设置下的厂商结果。
企业工作编程、金融、法律研究、写作和视觉分析仍需按领域设计验收测试。
多模态理解图表、文档和长视频发布文中没有完整的输入 schema。
网络防御发现、验证和修复漏洞防御者和普通用户的访问及 guardrail 不同。
输出空间Google 表示最高 1M 输出 token是上限,不是建议生成一百万 token。

Google 还描述了内部案例:Argon 在量子优化中比已公布 baseline 高 40%,通过数据中心全局分析释放了超过 300 TiB 内存,并让 libgav1 解码器的 Rust 移植版本比原有 Rust 实现快 2.7 倍。这些是 Google 工作流的厂商陈述,不是独立实验;大型重写在上线前仍经过自动和人工审计。

它的实际定位已经很清楚:适合需要规划、调用工具、检查长证据并在多轮中保持一致性的工作。只问一个短问题无法测出这个优势。

Benchmark:强信号,但边界有限

评测Gemini 4 ArgonGoogle 说明的测量对象
DeepSWE v1.177.9%长程软件工程
AutomationBench51.3%端到端业务功能执行
LVBench91.7%长视频理解
CWE-bench v168%漏洞修复,并列第一
Vals Finance Agent v2宣称领先多步骤金融研究
Harvey Legal Agent Benchmark宣称领先法律研究和起草

这些数字支持一个有限结论:Google 瞄准的是长上下文、工具使用和持续推理都很重要的任务。 它们不能证明通用排名。DeepSWE 使用 Google 的设置,不同供应商的 prompt、harness、重试、工具权限和停止条件都可能不同。

9to5Google 转述了 Google 的 DeepSWE 对比:Argon 77.9%、Claude Opus 5.5 74.2%、GPT-6 Astra 74.1%。这只是发布语境,不是同条件的独立测试。Artificial Analysis 的高推理快照显示 Intelligence Index 53,但速度仍未提供。

真正决策时,要记录模型、推理设置、工具、上下文、重试、输出 token、延迟、最终通过结果和人工修复分钟数。只有一个分数无法预测 Agent 的成本或可靠性。

网络安全为何成为发布门槛

Google 没有把 Argon 当作普通模型发布。可信防御者和内部团队将获得无网络安全 guardrail 的版本,以便使用完整防御能力;全面开放之前,Google 还会继续强化滥用防护。

公告列出四个方向:

  1. 防止滥用。 监测网络攻击和 CBRN 滥用,同时保留正当的双重用途研究。
  2. 防御间接 prompt injection。 通过 red team 和对抗训练,抵抗藏在检索内容里的恶意指令。
  3. 监测失配。 观察推理和行动,在行为超出用户意图时停止执行。
  4. 加固环境。 在高风险评测前隔离并封存 sandbox。

这是安全与发布控制的说明,不是允许攻击第三方系统。评测时请使用自有代码、合成漏洞、隔离网络和明确的停止条件。

价格与 API 状态

计费项目Google 公布的 Argon 价格
首发输入$2.00 / 1M token
首发输出$10.00 / 1M token
缓存输入比输入价格低 95%,按首发价为 $0.10 / 1M
首发期之后输入 $4.00 / 输出 $20.00 / 1M token

这是供应商价格,不是 OmniaKey 报价。公告也没有给出全面可用日期、准确 model ID、支持的 endpoint、速率限制、Batch 条件、地区规则或最终缓存合同。

不要把 gemini-4-argon 直接填进客户端并假设它是有效 ID。Google 发布模型页后,要同时核对精确字符串、API 版本、SDK 行为、thinking 控制、streaming、工具 schema 和输出计费。OmniaKey 的实时目录才是网关可用性和价格的依据;10 月 1 日 Argon 尚未列出。

可以在不把密钥放进 URL 的情况下查询两个目录:

bash
set -o pipefail
curl --fail-with-body --silent --show-error \
  https://generativelanguage.googleapis.com/v1beta/models \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
| jq -r '.models[]?.name | sub("^models/"; "") | select(. == "gemini-4-argon" or startswith("gemini-4-argon-"))'
bash
set -o pipefail
curl --fail-with-body --silent --show-error https://api.omniakey.com/v1/models \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
| jq -r '.data[]?.id | select(. == "gemini-4-argon" or startswith("gemini-4-argon-"))'

空结果只说明该凭据在该时间点没有匹配项,不代表私有测试账号没有权限,也不是在生产里发明别名的理由。

早期独立快照怎么说

Artificial Analysis 将 Gemini 4 Argon (High) 列为支持文本和图像输入、文本输出以及 1M token 上下文的推理模型。其 Intelligence Index 为 53,明显高于约 26 的追踪模型中位数;按该评测估算,每个任务成本 $1.99。评测中生成了 110M token,中位数为 82M。

同一页面将输出速度标记为不可用,并说明供应商价格仍处于早期数据阶段。因此它适合提供初步质量与冗长度信号,不适合作为延迟承诺或 Google 价目表的替代。引用时保留页面核对日期。

访问开放后如何评测

使用固定评测集,不要只收集发布当天的 prompt:

  1. 仓库改动。 给出一个范围明确、测试确定、差异可审查的功能。
  2. 长程调试。 设置一个根因已知但不明显的跨模块故障。
  3. 工具权限。 测试允许读取、拒绝写入、错误参数、取消和重试。
  4. 知识工作。 要求完成带来源和审阅标准的金融或法律文档。
  5. 多模态上下文。 使用有标准答案的长视频、图表或文档集合。
  6. 安全沙箱。 使用合成漏洞,确认越过边界时会停止。

每次记录模型 ID 和供应商、推理设置和工具定义、输入/缓存/推理/可见输出 token、首 token 时间、总延迟、重试和错误、首次通过情况、人工修复分钟数以及直接或网关成本。

用相同 commit 和工具与 Gemini 3.8 Flash、Claude Opus 5.5 或 GPT-6 Astra 对比。更高分数如果伴随更多重试和人工修复,可能反而更贵。

结论:放进队列,不要自动迁移

Gemini 4 Argon 是 2026 年最重要的模型发布之一。DeepSWE、企业工作、视频和网络安全结果与它面向长程工具任务的定位一致。API 开放后,1M 输出上限和 $2/$10 首发价格可以支持可量化的试点。

但限制也很明确:主要跑分由 Google 控制,公开 model ID 和 SDK 合同尚未发布,访问是分阶段的,独立速度数据也还没准备好。现在先固定基线,通过文档化渠道申请访问,等同一验收集通过后再切换。 OmniaKey 的当前线路请查 模型目录;Argon 扩大开放前,Gemini 3.8 Flash 价格指南仍是 Google 成本参考。

常见问题

Gemini 4 Argon 对所有人开放了吗?

没有。Google 先向 Fairwind 可信防御者提供,然后计划扩展到付费 API 客户和 Google AI Ultra 订阅者,尚未公布全面可用日期。

Gemini 4 Argon 的 API model ID 是什么?

Google 公布了产品名,但发布材料没有给出稳定的公开 ID。在模型页和 Models API 返回精确 ID 之前,应把 gemini-4-argon 只当作搜索字符串。

Gemini 4 Argon 多少钱?

首发价格为输入每 1M token $2、输出 $10,缓存输入便宜 95%;之后 Google 表示会变为 $4 和 $20。这不是 OmniaKey 价格。

Argon 有一百万 token 的上下文吗?

Google 明确公布的是 1M 输出上限,高于此前的 64K;Artificial Analysis 当前列出 1M 上下文。做预算前请以 Google API 文档中的最终输入和输出合同为准。

现在应该替换 Gemini 3.8 Flash 吗?

不应该自动替换。保持当前已验证的线路作为基线,等 Argon 的访问、价格和 SDK 行为正式记录后再复跑同一批任务。

核对过的来源

官方来源:

独立与二手来源:

**核对日期:2026-10-01。**价格、可用性、model ID 和评测结果都会变化;修改生产配置前,请重新阅读 Google 最新模型页和 OmniaKey 实时目录。