Gemini 4 Argon 评测:发布很强,但公开 API 还没到
Argon 看起来是一次重要的前沿模型升级,但发布当天不宜直接迁移生产流量,应先核对证据并等待可调用的正式合同。
Gemini 4 Argon 是 Google Gemini 4 代际的首个前沿模型。 Google 在 2026-09-30 宣布了它,定位是长程软件工程、企业知识工作和防御性网络安全。模型确实已经发布,但访问是分阶段的:先通过 Fairwind Program 提供给可信的网络防御者,然后才扩展到付费 API 客户和 Google AI Ultra 订阅者。
因此本文是发布评测,不是我们亲自跑出的 API benchmark。Google 报告了 DeepSWE、AutomationBench、LVBench 和安全评估中的强劲结果。Artificial Analysis 已有早期独立快照,但速度面板尚未完整。我们没有使用 Gemini 凭据或运行付费请求;核对时 Argon 也不在 OmniaKey 公开目录中。
事实核对日期:2026-10-01。 下文的发布事实和厂商跑分来自 Google 公告及安全材料,独立数据会单独标注。Google 尚未发布稳定的公开 model ID、完整 endpoint 合同、SDK 迁移指南或全面可用日期,因此本文不虚构请求示例,也不声称已经可以用于生产。
先给结论
| 问题 | 截至 2026-10-01 的核实答案 |
|---|---|
| 发布了什么 | Gemini 4 Argon,面向编程、企业知识工作和网络防御的前沿模型。 |
| 今天所有人都能调用吗 | 不能。先向可信防御者开放,再扩展到付费 API 客户和 Google AI Ultra 订阅者。 |
| API model ID 是什么 | 产品名已经公布,但发布材料没有给出稳定的公开 API ID。不要猜 gemini-4-argon。 |
| 上下文或输出上限是多少 | Google 表示输出 token 上限为 1M,高于此前 Gemini 的 64K;最终输入合同仍待发布。 |
| 首发价格是多少 | 输入每 1M token $2,输出 $10;缓存输入在此基础上便宜 95%。 |
| 首发期之后呢 | Google 表示之后为输入 $4、输出 $20 / 1M token。 |
| 有可复现的公开 benchmark 吗 | Google 公布了厂商结果,Artificial Analysis 给出早期 Intelligence Index 53。我们没有运行第一手付费 benchmark。 |
| OmniaKey 已经路由 Argon 吗 | 核对当天不在 OmniaKey 公开目录中。准备网关迁移前先查实时目录。 |
一句话判断是:有潜力,但还没有准备好在未经测试的情况下切生产。账号可以调用后,值得放到评测队列最前面;在那之前可用 Gemini 3.8 Flash 等已通过验收的线路作为基线。
Google 公布了什么
Google 将 Argon 称为新的前沿模型,并表示它已经用于内部工作流。首批外部用户是 Fairwind Program 中的可信网络防御者。Google 计划“尽快”向开发者、企业和消费者扩展,首批一般客户是付费 API 客户与 Google AI Ultra 订阅者。
公告能证明模型已经存在,但不能证明每个 Google AI Studio 项目、地区、SDK、网关或账号都能调用。此前的 Gemini 4 状态指南 正确地区分了“已命名的训练项目”和“可调用的 API 模型”。这次发布让 Argon 进入“已公布产品”阶段,但全面 API 可用性仍要单独核查。
能力画像
| 能力 | 已公布内容 | 应该如何理解 |
|---|---|---|
| 长程推理 | 面向复杂、多步骤流程的深度推理 | 是目标场景,不代表所有长 prompt 都有效。 |
| 软件工程 | Google 报告 DeepSWE v1.1 为 77.9% | 特定 harness 和设置下的厂商结果。 |
| 企业工作 | 编程、金融、法律研究、写作和视觉分析 | 仍需按领域设计验收测试。 |
| 多模态 | 理解图表、文档和长视频 | 发布文中没有完整的输入 schema。 |
| 网络防御 | 发现、验证和修复漏洞 | 防御者和普通用户的访问及 guardrail 不同。 |
| 输出空间 | Google 表示最高 1M 输出 token | 是上限,不是建议生成一百万 token。 |
Google 还描述了内部案例:Argon 在量子优化中比已公布 baseline 高 40%,通过数据中心全局分析释放了超过 300 TiB 内存,并让 libgav1 解码器的 Rust 移植版本比原有 Rust 实现快 2.7 倍。这些是 Google 工作流的厂商陈述,不是独立实验;大型重写在上线前仍经过自动和人工审计。
它的实际定位已经很清楚:适合需要规划、调用工具、检查长证据并在多轮中保持一致性的工作。只问一个短问题无法测出这个优势。
Benchmark:强信号,但边界有限
| 评测 | Gemini 4 Argon | Google 说明的测量对象 |
|---|---|---|
| DeepSWE v1.1 | 77.9% | 长程软件工程 |
| AutomationBench | 51.3% | 端到端业务功能执行 |
| LVBench | 91.7% | 长视频理解 |
| CWE-bench v1 | 68% | 漏洞修复,并列第一 |
| Vals Finance Agent v2 | 宣称领先 | 多步骤金融研究 |
| Harvey Legal Agent Benchmark | 宣称领先 | 法律研究和起草 |
这些数字支持一个有限结论:Google 瞄准的是长上下文、工具使用和持续推理都很重要的任务。 它们不能证明通用排名。DeepSWE 使用 Google 的设置,不同供应商的 prompt、harness、重试、工具权限和停止条件都可能不同。
9to5Google 转述了 Google 的 DeepSWE 对比:Argon 77.9%、Claude Opus 5.5 74.2%、GPT-6 Astra 74.1%。这只是发布语境,不是同条件的独立测试。Artificial Analysis 的高推理快照显示 Intelligence Index 53,但速度仍未提供。
真正决策时,要记录模型、推理设置、工具、上下文、重试、输出 token、延迟、最终通过结果和人工修复分钟数。只有一个分数无法预测 Agent 的成本或可靠性。
网络安全为何成为发布门槛
Google 没有把 Argon 当作普通模型发布。可信防御者和内部团队将获得无网络安全 guardrail 的版本,以便使用完整防御能力;全面开放之前,Google 还会继续强化滥用防护。
公告列出四个方向:
- 防止滥用。 监测网络攻击和 CBRN 滥用,同时保留正当的双重用途研究。
- 防御间接 prompt injection。 通过 red team 和对抗训练,抵抗藏在检索内容里的恶意指令。
- 监测失配。 观察推理和行动,在行为超出用户意图时停止执行。
- 加固环境。 在高风险评测前隔离并封存 sandbox。
这是安全与发布控制的说明,不是允许攻击第三方系统。评测时请使用自有代码、合成漏洞、隔离网络和明确的停止条件。
价格与 API 状态
| 计费项目 | Google 公布的 Argon 价格 |
|---|---|
| 首发输入 | $2.00 / 1M token |
| 首发输出 | $10.00 / 1M token |
| 缓存输入 | 比输入价格低 95%,按首发价为 $0.10 / 1M |
| 首发期之后 | 输入 $4.00 / 输出 $20.00 / 1M token |
这是供应商价格,不是 OmniaKey 报价。公告也没有给出全面可用日期、准确 model ID、支持的 endpoint、速率限制、Batch 条件、地区规则或最终缓存合同。
不要把 gemini-4-argon 直接填进客户端并假设它是有效 ID。Google 发布模型页后,要同时核对精确字符串、API 版本、SDK 行为、thinking 控制、streaming、工具 schema 和输出计费。OmniaKey 的实时目录才是网关可用性和价格的依据;10 月 1 日 Argon 尚未列出。
可以在不把密钥放进 URL 的情况下查询两个目录:
set -o pipefail
curl --fail-with-body --silent --show-error \
https://generativelanguage.googleapis.com/v1beta/models \
-H "x-goog-api-key: $GEMINI_API_KEY" \
| jq -r '.models[]?.name | sub("^models/"; "") | select(. == "gemini-4-argon" or startswith("gemini-4-argon-"))'
set -o pipefail
curl --fail-with-body --silent --show-error https://api.omniakey.com/v1/models \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
| jq -r '.data[]?.id | select(. == "gemini-4-argon" or startswith("gemini-4-argon-"))'
空结果只说明该凭据在该时间点没有匹配项,不代表私有测试账号没有权限,也不是在生产里发明别名的理由。
早期独立快照怎么说
Artificial Analysis 将 Gemini 4 Argon (High) 列为支持文本和图像输入、文本输出以及 1M token 上下文的推理模型。其 Intelligence Index 为 53,明显高于约 26 的追踪模型中位数;按该评测估算,每个任务成本 $1.99。评测中生成了 110M token,中位数为 82M。
同一页面将输出速度标记为不可用,并说明供应商价格仍处于早期数据阶段。因此它适合提供初步质量与冗长度信号,不适合作为延迟承诺或 Google 价目表的替代。引用时保留页面核对日期。
访问开放后如何评测
使用固定评测集,不要只收集发布当天的 prompt:
- 仓库改动。 给出一个范围明确、测试确定、差异可审查的功能。
- 长程调试。 设置一个根因已知但不明显的跨模块故障。
- 工具权限。 测试允许读取、拒绝写入、错误参数、取消和重试。
- 知识工作。 要求完成带来源和审阅标准的金融或法律文档。
- 多模态上下文。 使用有标准答案的长视频、图表或文档集合。
- 安全沙箱。 使用合成漏洞,确认越过边界时会停止。
每次记录模型 ID 和供应商、推理设置和工具定义、输入/缓存/推理/可见输出 token、首 token 时间、总延迟、重试和错误、首次通过情况、人工修复分钟数以及直接或网关成本。
用相同 commit 和工具与 Gemini 3.8 Flash、Claude Opus 5.5 或 GPT-6 Astra 对比。更高分数如果伴随更多重试和人工修复,可能反而更贵。
结论:放进队列,不要自动迁移
Gemini 4 Argon 是 2026 年最重要的模型发布之一。DeepSWE、企业工作、视频和网络安全结果与它面向长程工具任务的定位一致。API 开放后,1M 输出上限和 $2/$10 首发价格可以支持可量化的试点。
但限制也很明确:主要跑分由 Google 控制,公开 model ID 和 SDK 合同尚未发布,访问是分阶段的,独立速度数据也还没准备好。现在先固定基线,通过文档化渠道申请访问,等同一验收集通过后再切换。 OmniaKey 的当前线路请查 模型目录;Argon 扩大开放前,Gemini 3.8 Flash 价格指南仍是 Google 成本参考。
常见问题
Gemini 4 Argon 对所有人开放了吗?
没有。Google 先向 Fairwind 可信防御者提供,然后计划扩展到付费 API 客户和 Google AI Ultra 订阅者,尚未公布全面可用日期。
Gemini 4 Argon 的 API model ID 是什么?
Google 公布了产品名,但发布材料没有给出稳定的公开 ID。在模型页和 Models API 返回精确 ID 之前,应把 gemini-4-argon 只当作搜索字符串。
Gemini 4 Argon 多少钱?
首发价格为输入每 1M token $2、输出 $10,缓存输入便宜 95%;之后 Google 表示会变为 $4 和 $20。这不是 OmniaKey 价格。
Argon 有一百万 token 的上下文吗?
Google 明确公布的是 1M 输出上限,高于此前的 64K;Artificial Analysis 当前列出 1M 上下文。做预算前请以 Google API 文档中的最终输入和输出合同为准。
现在应该替换 Gemini 3.8 Flash 吗?
不应该自动替换。保持当前已验证的线路作为基线,等 Argon 的访问、价格和 SDK 行为正式记录后再复跑同一批任务。
核对过的来源
官方来源:
- Google:Gemini 4 Argon 公告 — 发布范围、能力、价格、benchmark 和安全 rollout
- Google Gemini API 模型目录 — 公开模型列表
- Google Gemini API Models 参考 — 账号级可用性
独立与二手来源:
- Artificial Analysis:Gemini 4 Argon (High) — 早期 Intelligence Index、单任务成本、上下文和速度状态
- 9to5Google:Gemini 4 Argon 发布 — benchmark 对比和 rollout
- Ars Technica:为什么 Argon 还没有全面可用 — 访问与安全背景
- TechCrunch:Gemini 4 Argon 发布报道 — 独立发布报道
**核对日期:2026-10-01。**价格、可用性、model ID 和评测结果都会变化;修改生产配置前,请重新阅读 Google 最新模型页和 OmniaKey 实时目录。