Claude Opus 5 评测
难度高、运行时间长的 Agent 任务值得升级到 Opus 5,日常任务仍应优先考虑 Sonnet 5 的成本。
Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,并给出一个很有吸引力的定位:用 Claude Fable 5 一半的 API 价格,提供接近前沿旗舰的智能水平。对真实用户来说,更关键的问题不是它有没有拿下发布榜单第一,而是它能否用更少的人力和成本完成更多实际工作。
我们的结论是:对于复杂、长时间运行的任务,值得升级。Opus 5 与 Opus 4.8 的标准 Token 单价相同,但公开的编程和专业工作评测显示出明显提升。若主要是单文件修改、信息抽取、分类或高并发对话,Sonnet 5 依然更便宜,通常也已经足够快。
证据说明,核对日期为 2026 年 7 月 26 日。 这是一篇基于公开证据的评测,不宣称 OmniaKey 独立复跑了所有基准。我们交叉核对了 Anthropic 发布资料与技术文档、Frontier-Bench 公开榜单,以及 Artificial Analysis 独立运行的 GDPval-AA v2。厂商自测结果会单独标明。
Claude Opus 5 评测:先看结论
| 你的工作负载 | 建议从哪里开始 | 原因 |
|---|---|---|
| 多文件功能、复杂调试、长时间 Agent 任务 | Opus 5,high effort | 能力和成本最均衡;只有自己的评测证明有收益时再升到 xhigh |
| 日常编程、客服、抽取、分类或高并发任务 | Sonnet 5 | Token 单价更低,官方标注的相对延迟也更快 |
| 现有 Opus 4.8 集成 | 测试后迁移到 Opus 5 | 标准价格不变,公开结果更强,但行为变化仍需回归测试 |
| 成本次要,只追求最高能力 | 同时测试 Opus 5 与 Fable 5 | Fable 的定位上限更高,但 Opus 价格只有一半,并在多个公开任务中接近或超过它 |
Opus 5 最有价值的提升并不是一次生成更多代码,而是在长任务里持续保持方向:找到根因而不是只修表面症状,持续调用工具直到验证成功,并完整交付结果而不是留下占位内容。
相比 Opus 4.8 变了什么
| 规格 | Claude Opus 5 |
|---|---|
| API 模型 ID | claude-opus-5 |
| 上下文窗口 | 100 万 Token,同时是默认值与最大值 |
| 同步最大输出 | 128,000 Token |
| 可靠知识截止时间 | 2026 年 5 月 |
| 标准 API 价格 | 每百万输入 Token $5;每百万输出 Token $25 |
| Prompt Cache | 5 分钟写入 $6.25;1 小时写入 $10;命中 $0.50 |
| Thinking | 默认开启 Adaptive Thinking |
| Effort 档位 | low、medium、high、xhigh、max;默认 high |
它与 Opus 4.8 的窗口和标价相同,但运行方式已经变化。Opus 5 默认进行自适应思考,增加 effort 时更能稳定换来能力提升,并把可缓存 Prompt 的最短长度从 1,024 Token 降到 512 Token。它还提供测试版的会话中途工具变更,Agent 可以在不让已有 Prompt Cache 失效的情况下增加或删除工具。
Fast mode 目前是 Claude API 的 research preview。Anthropic 表示速度约为标准模式的 2.5 倍,但价格也翻倍到每百万输入 $10、输出 $50。它购买的是延迟,不是折扣。
基准结果很强,但必须看脚注
Frontier-Bench 的领先幅度很大
Frontier-Bench v0.1 公开榜单中,Opus 5 配合 mini-SWE-agent 的任务解决率为 43.53% +/- 1.65%。同一榜单的 Fable 5 为 33.78%,Opus 4.8 为 21.08%。也就是说,榜单里的 Opus 5 结果约为 Opus 4.8 的两倍,并领先 Fable 5 约 10 个百分点。
这个结果很重要,但不能当成完全中立的实验室对比。Anthropic 的脚注说明,这是他们在 GKE 后端运行的内部测试,每道题取 5 次尝试的平均值;当 Opus 5 或 Fable 5 被安全分类器拒绝时,还会回退到 Opus 4.8。它能支持“Opus 5 更擅长高难度 Agent 工作”这个判断,但不能证明每个代码库都会获得相同比例的提升。
GDPval-AA 提供了更强的独立证据
Artificial Analysis 的 GDPval-AA v2 覆盖 44 种职业、220 个真实工作任务。模型在带 Shell 和网页工具的 Agent 循环里工作,最后交付文档、表格、幻灯片、图表等成品,再通过盲测两两比较得到 Elo 分数。
| 模型与 effort | GDPval-AA v2 Elo | 榜单展示的 95% 区间 |
|---|---|---|
Opus 5,max | 1861 | -25 / +25 |
Opus 5,xhigh | 1827 | -24 / +24 |
Fable 5,max | 1747 | -17 / +17 |
Opus 5,high | 1741 | -23 / +23 |
GPT-5.6 Sol,max | 1735 | -17 / +17 |
Opus 5,medium | 1632 | -22 / +22 |
Sonnet 5,max | 1603 | -17 / +17 |
Opus 4.8,max | 1593 | -16 / +16 |
Opus 5,low | 1454 | -20 / +20 |
这里有两个真正影响决策的结论。第一,Opus 5 在 max 和 xhigh 档位明显领先这份独立榜单。第二,effort 绝不是装饰参数:low 到 max 相差 407 Elo。默认 high 下,Opus 5、Fable 5 与 GPT-5.6 Sol 的置信区间重叠,因此 6 分的名次差异不应被包装成决定性胜利。
Anthropic 还表示:Opus 5 在 max 下的 CursorBench 峰值与 Fable 5 相差不到 0.5%,但单任务成本只有一半;ARC-AGI 3 得分是第二名的 3 倍;OSWorld 2.0 则用略高于三分之一的成本超过 Fable 5 最佳结果。这些信息可以帮助判断方向,但都来自发布材料,因此我们给它们的权重低于独立 GDPval-AA。
哪些能力看起来是真升级
长程编程。 Anthropic 的 Prompt 指南把多文件功能、大型重构和端到端交付列为 Opus 5 的优势,Frontier-Bench 结果也支持这个定位。真实价值是减少半途留下的 stub,并降低人类在任务中途接管的次数。
调试与 Code Review。 早期用户反馈更强调根因分析,而不是只消除当前报错。Anthropic 还表示它在较低 effort 下仍能保持不错的审查准确率。团队仍应在自己的 PR 样本上统计误报和漏报,发布证言不能代替本地精确率与召回率。
视觉和办公文档。 Opus 5 被定位为更擅长图表、流程图、前端视觉复刻、复杂电子表格与幻灯片。只有当 Agent 能查看渲染结果并继续迭代时,这项优势才更容易兑现;只让模型一次性输出代码或 Markdown,收益会小很多。
自我验证。 它更常主动检查结果。开放任务会因此受益,但沿用“务必再次检查”“再开一个 Agent 验证”之类的旧 Prompt,可能造成重复验证、更多 Token 和不必要的委派。
如果任务只是一个文件里的精确修改,并且验收条件非常清楚,升级收益会小得多。便宜模型往往在 Opus 5 的深层推理有机会发挥之前就已经完成任务。
Claude Opus 5 的真实任务成本
假设一次任务发送 100,000 个未缓存输入 Token,并返回 10,000 个输出 Token,按官方标准价计算:
| 模型 | 标准输入 / 输出价格 | 示例任务成本 |
|---|---|---|
| Claude Fable 5 | 每百万 $10 / $50 | $1.50 |
| Claude Opus 5 | 每百万 $5 / $25 | $0.75 |
| Claude Opus 4.8 | 每百万 $5 / $25 | $0.75 |
| Claude Sonnet 5 | 每百万 $3 / $15 | 标准价 $0.45 |
Sonnet 5 在 2026 年 8 月 31 日前有每百万 $2 / $10 的首发价格,因此促销期内同一示例只需 $0.30。上表没有包含工具费用或任何网关价格。
100 万上下文不是免费容量。第一次填满窗口,仅输入就要 $5,尚未计算回答;同一百万 Token 命中 Cache 时只需 $0.50,因此重复读取代码库或知识库时,Prompt Cache 会彻底改变成本结构。5 分钟缓存写入为每百万 $6.25,1 小时写入为 $10。
Token 单价也不等于任务总价。更高 effort 可能增加思考 Token 和工具调用,但更强的模型也可能用更少轮次完成工作。应比较“成功完成一个任务”的成本,而不只是费率表。当前 Claude Opus 5 模型页 会单独展示 OmniaKey 的实时网关价格与 Anthropic 标准价。
哪些用户应该升级
Opus 4.8 用户: 做一轮针对性回归后升级。标准价格和上下文限制都没有变化;只要 Opus 5 能提升你自己的任务完成率,就没有太强的经济理由继续停在 4.8。迁移前要测试回答长度、Thinking 行为、工具调用和延迟。
Sonnet 5 用户: 不要把所有请求一次性迁走。日常轮次继续用 Sonnet,把模糊 Bug、架构设计、大型重构和失败代价高的任务升级到 Opus 5。按任务路由通常比所有任务固定使用同一个模型更划算。
Fable 5 用户: 成本敏感的生产任务应先测试 Opus 5。Fable 仍是 Anthropic 定位中能力上限最高的公开模型,但现有证据已经显示,很多工作流里 Opus 5 用一半 Token 价格就能接近、持平甚至超过它。只有自己的评测证明差异重要时,才值得支付 Fable 溢价。
安全团队: 不要把通用榜单直接套到进攻安全任务。Anthropic 有意没有把 Opus 5 训练成进攻型网络安全模型,它在漏洞利用开发上仍落后于 Mythos 5。发现源代码漏洞与产出可工作的 exploit 是两类任务。
切换前必须测试的迁移陷阱
- 把模型 ID 从
claude-opus-4-8精确改为claude-opus-5。Claude 5 的无日期 ID 也是固定快照,不是自动漂移的 alias。 - 重新检查
max_tokens。Thinking 默认开启,而且该限制同时覆盖思考与可见输出。 - 不要把
thinking: {"type": "disabled"}与xhigh或max组合,API 会返回 HTTP 400。若目标是省钱,应保留 Thinking 并降低 effort。 - 降低 effort 不一定会缩短用户看到的回答;需要另外在 Prompt 中明确要求简洁。
- 删除旧 Prompt 中强制重复验证或强制启用子 Agent 的指令。Opus 5 本来就比 Opus 4.8 更容易主动做这两件事。
- 在自己的任务上重新扫描 effort。Anthropic 建议从默认
high开始,高难度 Agent 任务再升到xhigh,质量不下降时则使用low或medium。
更可靠的生产上线方式,是用同一组固定任务比较 medium、high、xhigh,同时记录成功率、人工修正时间、延迟、输入、缓存、输出和工具调用成本,最后按任务类型路由。一个令人惊艳的聊天记录不等于评测。
最终结论
如果一个开发者最昂贵的问题通常很长、很模糊并且依赖大量工具,Claude Opus 5 是 Anthropic 当前产品线里最合理的默认选择。它让 Opus 4.8 用户以相同标准价格获得显著的公开质量提升,也让多个接近 Fable 的工作负载变得更容易负担。
但它不是所有任务的统一默认。日常工作用 Sonnet 5 仍更经济,max effort 可能通过更多 Token 抵消价格优势,而且发布初期的证据仍有相当一部分来自 Anthropic 自测。先从 high 开始,衡量成功任务成本,再有选择地升级。
常见问题
Claude Opus 5 比 Opus 4.8 强吗?
现有公开证据显示是。Frontier-Bench 中 Opus 5 的解决率为 43.53%,Opus 4.8 为 21.08%;GDPval-AA 中两者在 max 下分别为 1861 和 1593 Elo。标准 API Token 价格相同,但你的 Prompt 和 Agent 框架仍需回归测试。
Claude Opus 5 和 Sonnet 5 怎么选?
复杂推理和长时间 Agent 工作优先 Opus 5;日常任务优先更便宜、更快的 Sonnet 5。最好的方式通常是按任务路由,而不是每次请求都支付 Opus 价格。
Claude Opus 5 多少钱?
Anthropic 标准 API 价格是每百万输入 Token $5、输出 Token $25,Cache 命中为 $0.50。Fast mode 的输入和输出价格分别为 $10 与 $50。
Claude Opus 5 支持 1M 上下文吗?
支持。100 万 Token 同时是默认窗口和最大窗口,同步输出上限为 128,000 Token。客户端或网关仍可能设置更低限制。
应该用哪个 effort 档位?
从 high 开始。自己的评测证明质量相近时用 medium 节省成本;高难度编程或长程 Agent 使用 xhigh;只有不限制 Token 且确实获得可测收益时才用 max。