限时 · 同款 GPT 节省 93%、Claude 节省 80%
博客
产品对比

Claude Opus 5 评测

难度高、运行时间长的 Agent 任务值得升级到 Opus 5,日常任务仍应优先考虑 Sonnet 5 的成本。

10 分钟阅读OmniaKey
Claude Opus 5Claude CodeAI codingmodel review

Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,并给出一个很有吸引力的定位:用 Claude Fable 5 一半的 API 价格,提供接近前沿旗舰的智能水平。对真实用户来说,更关键的问题不是它有没有拿下发布榜单第一,而是它能否用更少的人力和成本完成更多实际工作。

我们的结论是:对于复杂、长时间运行的任务,值得升级。Opus 5 与 Opus 4.8 的标准 Token 单价相同,但公开的编程和专业工作评测显示出明显提升。若主要是单文件修改、信息抽取、分类或高并发对话,Sonnet 5 依然更便宜,通常也已经足够快。

证据说明,核对日期为 2026 年 7 月 26 日。 这是一篇基于公开证据的评测,不宣称 OmniaKey 独立复跑了所有基准。我们交叉核对了 Anthropic 发布资料与技术文档、Frontier-Bench 公开榜单,以及 Artificial Analysis 独立运行的 GDPval-AA v2。厂商自测结果会单独标明。

Claude Opus 5 评测:先看结论

你的工作负载建议从哪里开始原因
多文件功能、复杂调试、长时间 Agent 任务Opus 5,high effort能力和成本最均衡;只有自己的评测证明有收益时再升到 xhigh
日常编程、客服、抽取、分类或高并发任务Sonnet 5Token 单价更低,官方标注的相对延迟也更快
现有 Opus 4.8 集成测试后迁移到 Opus 5标准价格不变,公开结果更强,但行为变化仍需回归测试
成本次要,只追求最高能力同时测试 Opus 5 与 Fable 5Fable 的定位上限更高,但 Opus 价格只有一半,并在多个公开任务中接近或超过它

Opus 5 最有价值的提升并不是一次生成更多代码,而是在长任务里持续保持方向:找到根因而不是只修表面症状,持续调用工具直到验证成功,并完整交付结果而不是留下占位内容。

相比 Opus 4.8 变了什么

规格Claude Opus 5
API 模型 IDclaude-opus-5
上下文窗口100 万 Token,同时是默认值与最大值
同步最大输出128,000 Token
可靠知识截止时间2026 年 5 月
标准 API 价格每百万输入 Token $5;每百万输出 Token $25
Prompt Cache5 分钟写入 $6.25;1 小时写入 $10;命中 $0.50
Thinking默认开启 Adaptive Thinking
Effort 档位lowmediumhighxhighmax;默认 high

它与 Opus 4.8 的窗口和标价相同,但运行方式已经变化。Opus 5 默认进行自适应思考,增加 effort 时更能稳定换来能力提升,并把可缓存 Prompt 的最短长度从 1,024 Token 降到 512 Token。它还提供测试版的会话中途工具变更,Agent 可以在不让已有 Prompt Cache 失效的情况下增加或删除工具。

Fast mode 目前是 Claude API 的 research preview。Anthropic 表示速度约为标准模式的 2.5 倍,但价格也翻倍到每百万输入 $10、输出 $50。它购买的是延迟,不是折扣。

基准结果很强,但必须看脚注

Frontier-Bench 的领先幅度很大

Frontier-Bench v0.1 公开榜单中,Opus 5 配合 mini-SWE-agent 的任务解决率为 43.53% +/- 1.65%。同一榜单的 Fable 5 为 33.78%,Opus 4.8 为 21.08%。也就是说,榜单里的 Opus 5 结果约为 Opus 4.8 的两倍,并领先 Fable 5 约 10 个百分点。

这个结果很重要,但不能当成完全中立的实验室对比。Anthropic 的脚注说明,这是他们在 GKE 后端运行的内部测试,每道题取 5 次尝试的平均值;当 Opus 5 或 Fable 5 被安全分类器拒绝时,还会回退到 Opus 4.8。它能支持“Opus 5 更擅长高难度 Agent 工作”这个判断,但不能证明每个代码库都会获得相同比例的提升。

GDPval-AA 提供了更强的独立证据

Artificial Analysis 的 GDPval-AA v2 覆盖 44 种职业、220 个真实工作任务。模型在带 Shell 和网页工具的 Agent 循环里工作,最后交付文档、表格、幻灯片、图表等成品,再通过盲测两两比较得到 Elo 分数。

模型与 effortGDPval-AA v2 Elo榜单展示的 95% 区间
Opus 5,max1861-25 / +25
Opus 5,xhigh1827-24 / +24
Fable 5,max1747-17 / +17
Opus 5,high1741-23 / +23
GPT-5.6 Sol,max1735-17 / +17
Opus 5,medium1632-22 / +22
Sonnet 5,max1603-17 / +17
Opus 4.8,max1593-16 / +16
Opus 5,low1454-20 / +20

这里有两个真正影响决策的结论。第一,Opus 5 在 maxxhigh 档位明显领先这份独立榜单。第二,effort 绝不是装饰参数:lowmax 相差 407 Elo。默认 high 下,Opus 5、Fable 5 与 GPT-5.6 Sol 的置信区间重叠,因此 6 分的名次差异不应被包装成决定性胜利。

Anthropic 还表示:Opus 5 在 max 下的 CursorBench 峰值与 Fable 5 相差不到 0.5%,但单任务成本只有一半;ARC-AGI 3 得分是第二名的 3 倍;OSWorld 2.0 则用略高于三分之一的成本超过 Fable 5 最佳结果。这些信息可以帮助判断方向,但都来自发布材料,因此我们给它们的权重低于独立 GDPval-AA。

哪些能力看起来是真升级

长程编程。 Anthropic 的 Prompt 指南把多文件功能、大型重构和端到端交付列为 Opus 5 的优势,Frontier-Bench 结果也支持这个定位。真实价值是减少半途留下的 stub,并降低人类在任务中途接管的次数。

调试与 Code Review。 早期用户反馈更强调根因分析,而不是只消除当前报错。Anthropic 还表示它在较低 effort 下仍能保持不错的审查准确率。团队仍应在自己的 PR 样本上统计误报和漏报,发布证言不能代替本地精确率与召回率。

视觉和办公文档。 Opus 5 被定位为更擅长图表、流程图、前端视觉复刻、复杂电子表格与幻灯片。只有当 Agent 能查看渲染结果并继续迭代时,这项优势才更容易兑现;只让模型一次性输出代码或 Markdown,收益会小很多。

自我验证。 它更常主动检查结果。开放任务会因此受益,但沿用“务必再次检查”“再开一个 Agent 验证”之类的旧 Prompt,可能造成重复验证、更多 Token 和不必要的委派。

如果任务只是一个文件里的精确修改,并且验收条件非常清楚,升级收益会小得多。便宜模型往往在 Opus 5 的深层推理有机会发挥之前就已经完成任务。

Claude Opus 5 的真实任务成本

假设一次任务发送 100,000 个未缓存输入 Token,并返回 10,000 个输出 Token,按官方标准价计算:

模型标准输入 / 输出价格示例任务成本
Claude Fable 5每百万 $10 / $50$1.50
Claude Opus 5每百万 $5 / $25$0.75
Claude Opus 4.8每百万 $5 / $25$0.75
Claude Sonnet 5每百万 $3 / $15标准价 $0.45

Sonnet 5 在 2026 年 8 月 31 日前有每百万 $2 / $10 的首发价格,因此促销期内同一示例只需 $0.30。上表没有包含工具费用或任何网关价格。

100 万上下文不是免费容量。第一次填满窗口,仅输入就要 $5,尚未计算回答;同一百万 Token 命中 Cache 时只需 $0.50,因此重复读取代码库或知识库时,Prompt Cache 会彻底改变成本结构。5 分钟缓存写入为每百万 $6.25,1 小时写入为 $10。

Token 单价也不等于任务总价。更高 effort 可能增加思考 Token 和工具调用,但更强的模型也可能用更少轮次完成工作。应比较“成功完成一个任务”的成本,而不只是费率表。当前 Claude Opus 5 模型页 会单独展示 OmniaKey 的实时网关价格与 Anthropic 标准价。

哪些用户应该升级

Opus 4.8 用户: 做一轮针对性回归后升级。标准价格和上下文限制都没有变化;只要 Opus 5 能提升你自己的任务完成率,就没有太强的经济理由继续停在 4.8。迁移前要测试回答长度、Thinking 行为、工具调用和延迟。

Sonnet 5 用户: 不要把所有请求一次性迁走。日常轮次继续用 Sonnet,把模糊 Bug、架构设计、大型重构和失败代价高的任务升级到 Opus 5。按任务路由通常比所有任务固定使用同一个模型更划算。

Fable 5 用户: 成本敏感的生产任务应先测试 Opus 5。Fable 仍是 Anthropic 定位中能力上限最高的公开模型,但现有证据已经显示,很多工作流里 Opus 5 用一半 Token 价格就能接近、持平甚至超过它。只有自己的评测证明差异重要时,才值得支付 Fable 溢价。

安全团队: 不要把通用榜单直接套到进攻安全任务。Anthropic 有意没有把 Opus 5 训练成进攻型网络安全模型,它在漏洞利用开发上仍落后于 Mythos 5。发现源代码漏洞与产出可工作的 exploit 是两类任务。

切换前必须测试的迁移陷阱

  1. 把模型 ID 从 claude-opus-4-8 精确改为 claude-opus-5。Claude 5 的无日期 ID 也是固定快照,不是自动漂移的 alias。
  2. 重新检查 max_tokens。Thinking 默认开启,而且该限制同时覆盖思考与可见输出。
  3. 不要把 thinking: {"type": "disabled"}xhighmax 组合,API 会返回 HTTP 400。若目标是省钱,应保留 Thinking 并降低 effort。
  4. 降低 effort 不一定会缩短用户看到的回答;需要另外在 Prompt 中明确要求简洁。
  5. 删除旧 Prompt 中强制重复验证或强制启用子 Agent 的指令。Opus 5 本来就比 Opus 4.8 更容易主动做这两件事。
  6. 在自己的任务上重新扫描 effort。Anthropic 建议从默认 high 开始,高难度 Agent 任务再升到 xhigh,质量不下降时则使用 lowmedium

更可靠的生产上线方式,是用同一组固定任务比较 mediumhighxhigh,同时记录成功率、人工修正时间、延迟、输入、缓存、输出和工具调用成本,最后按任务类型路由。一个令人惊艳的聊天记录不等于评测。

最终结论

如果一个开发者最昂贵的问题通常很长、很模糊并且依赖大量工具,Claude Opus 5 是 Anthropic 当前产品线里最合理的默认选择。它让 Opus 4.8 用户以相同标准价格获得显著的公开质量提升,也让多个接近 Fable 的工作负载变得更容易负担。

但它不是所有任务的统一默认。日常工作用 Sonnet 5 仍更经济,max effort 可能通过更多 Token 抵消价格优势,而且发布初期的证据仍有相当一部分来自 Anthropic 自测。先从 high 开始,衡量成功任务成本,再有选择地升级。

常见问题

Claude Opus 5 比 Opus 4.8 强吗?

现有公开证据显示是。Frontier-Bench 中 Opus 5 的解决率为 43.53%,Opus 4.8 为 21.08%;GDPval-AA 中两者在 max 下分别为 1861 和 1593 Elo。标准 API Token 价格相同,但你的 Prompt 和 Agent 框架仍需回归测试。

Claude Opus 5 和 Sonnet 5 怎么选?

复杂推理和长时间 Agent 工作优先 Opus 5;日常任务优先更便宜、更快的 Sonnet 5。最好的方式通常是按任务路由,而不是每次请求都支付 Opus 价格。

Claude Opus 5 多少钱?

Anthropic 标准 API 价格是每百万输入 Token $5、输出 Token $25,Cache 命中为 $0.50。Fast mode 的输入和输出价格分别为 $10 与 $50。

Claude Opus 5 支持 1M 上下文吗?

支持。100 万 Token 同时是默认窗口和最大窗口,同步输出上限为 128,000 Token。客户端或网关仍可能设置更低限制。

应该用哪个 effort 档位?

high 开始。自己的评测证明质量相近时用 medium 节省成本;高难度编程或长程 Agent 使用 xhigh;只有不限制 Token 且确实获得可测收益时才用 max

核对来源