Claude Opus 5.5 评测
更低的价格让 Opus 5.5 值得升级测试,但现有 API 接入需要先检查兼容性。
Claude Opus 5.5 最值得关注的变化是:复杂任务的能力提升了,API 单价却降了。 Anthropic 于 2026 年 9 月 22 日正式发布这款模型,标准直连价格为每百万输入 token 4 美元、输出 token 20 美元。如果你正在用 Opus 5 做跨文件开发、疑难排错或长时间 Agent 任务,5.5 值得优先测试。
但升级不能只替换模型名。关闭思考、强制调用工具和修改历史消息的旧写法,可能直接返回 400;原本可见的工具间进度文字也可能消失。建议从新的默认档位 medium 开始,比较任务完成率、总账单和人工返工时间。
资料核验于 2026 年 9 月 23 日。 本文基于 Anthropic 正式公告、模型文档与迁移指南,没有运行独立 benchmark 或付费延迟测试。下文标明官方成绩与计算示例,价格均指 Anthropic 直连 API。
Opus 5.5 是什么?这次更新了哪些能力?
Opus 5.5 是 Claude 5.5 系列首款正式发布的模型,重点是长时间编程和知识工作。官方强调它在大型代码迁移、审查、图表理解和自然写作上的提升,并展示了使用更少步骤完成复杂工作的早期案例。这些案例适合用来设计测试,不能直接换算成你项目的交付承诺。
| 项目 | Claude Opus 5.5 |
|---|---|
| 发布时间 | 2026 年 9 月 22 日 |
| 直连 API 模型 ID | claude-opus-5-5 |
| 上下文 / 标准最大输出 | 1M / 128K token |
| 输入 → 输出 | 文本和图片 → 文本 |
| 可靠知识截止时间 | 2026 年 6 月 |
| 思考模式 | Adaptive thinking,始终开启 |
| 默认 effort | medium;Opus 5 原来是 high |
| 最小可缓存 prompt | 512 token |
百万上下文和 128K 标准输出上限没有比 Opus 5 扩大。文档中的 300K 输出属于 Batch API 的 beta 能力,不能当成同步请求上限。它也不是原生图片或视频生成模型;理解截图、生成绘图代码与直接生成图片是不同能力。
Opus 5.5 对比 Opus 5:真正影响使用的三个变化
第一是价格。 普通输入和输出单价下降 20%,缓存读取下降 60%。反复读取同一段代码库上下文的 Agent,尤其值得重新算账。
第二是默认行为。 不传 effort 时,5.5 使用 medium。即便固定为相同档位,5.5 每轮也可能比 Opus 5 思考更多,尤其是 xhigh 和 max。沿用旧配置不等于沿用旧预算。
第三是接口兼容性。 5.5 不允许关闭思考,不支持强制工具选择,并对思考块与历史上下文的绑定实施约束。对已有应用,这些变化比排名更值得先检查。
需要回顾上一代时,可以阅读 Opus 5 评测;日常任务如何在不同模型间分配,可参考 Claude Code 模型选择指南。
编程性能提升多少?如何理解官方跑分?
下面是 Anthropic 发布公告中的结果,并非 OmniaKey 复测,也不是我们重新读取的独立榜单快照。
| 测试 | Opus 5.5 | Opus 5 | Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 52.3% | 55.8% |
| FrontierCode v1.1 Main | 54.4% | 48.0% | 50.3% |
| CursorBench 4.0 | 57.8% | 46.6% | 51.8% |
| GDPval-AA v2.1 | 1846 | 1708 | 1735 |
官方说明,除特别标注外,Opus 5.5 使用 max;Terminal-Bench 使用 xhigh,标准误差为 ±2.6 个百分点。测试开启了生产安全机制,部分网络安全、生物学及前沿模型开发任务由 fallback 模型完成,因此不能把这张表理解为所有模型都在完全相同、无限制的条件下运行。
更贴近日常预算的是默认档位:官方报告 medium 在 FrontierCode 得到 54.6%,CursorBench 得到 52.5%。其中 FrontierCode 的 medium 分数略高于表中的 max,也说明 effort 越高并不保证每项测试都更高。
这些结果足以支持“优先试用”,不足以证明“所有任务都应该迁移”。GDPval-AA 这里使用 v2.1,不能直接与旧文章中的 v2 数字拼成趋势;真实成功率、延迟和返工成本仍要用自己的任务衡量。
Claude Opus 5.5 API 多少钱?
以下均为 Anthropic 全球直连 API 每百万 token 的美元价格,不含工具、税费、区域推理加价或第三方平台费用。
| 计费项 | Opus 5.5 | Opus 5 | 单价降幅 |
|---|---|---|---|
| 未缓存输入 | $4 | $5 | 20% |
| 输出,包含计费思考 token | $20 | $25 | 20% |
| 缓存读取 | $0.20 | $0.50 | 60% |
| 5 分钟缓存写入 | $5 | $6.25 | 20% |
| 1 小时缓存写入 | $8 | $10 | 20% |
用相同 token 数量做两个算例,能看出实际降幅取决于输入结构。下面的输出数量包含所有计费输出,包括思考 token。
| 相同工作量 | Opus 5.5 算式 | Opus 5.5 | Opus 5 |
|---|---|---|---|
| 100K 普通输入 + 10K 输出 | 0.1 × $4 + 0.01 × $20 | $0.60 | $0.75 |
| 100K 普通输入 + 900K 缓存命中 + 10K 输出 | 0.1 × $4 + 0.9 × $0.20 + 0.01 × $20 | $0.78 | $1.20 |
第二个算例节省 35%,但尚未计入之前建立缓存的写入费用。缓存命中必须以供应商返回的 usage 为准,重复发送相同文本并不自动证明已经命中。
因此,官方所说的**典型任务成本降低 40%不是所有请求统一打六折,而是默认设置下单价和 token 消耗共同作用的测试结果。官方的输出速度提高超过 30%**也不等于端到端任务时间同比缩短。
Fast mode 是研究预览,输入/输出价格为 $8/$40,官方宣称最高 2.5 倍速度,API 选项限 Anthropic 第一方平台。异步 Batch 的输入/输出价格为 $2/$10。两者都不能与普通交互请求混算。Claude 订阅额度和 API 余额也是两套账单,详见 Claude Code 价格指南。
API 怎么用?升级前检查这六项
- 删除关闭或手工预算思考的参数。
thinking.type: "disabled"和带budget_tokens的"enabled"都会返回 HTTP 400。省略thinking或使用adaptive,通过output_config.effort控制档位。 - 替换强制工具选择。
tool_choice的any、tool不再支持,改用auto或none。strict: true约束已选工具的参数,不能保证一定调用工具;需要固定 JSON 时考虑结构化输出。 - 保留历史上下文。 2026 年 8 月 31 日 00:00 UTC 起创建的账号,若修改思考块之前的 system、tools 或消息后再回传该块,可能返回 400。优先追加历史,确需修改时按 preserved thinking 文档处理。
- 按 type 解析内容块。 工具之间的进度文字改在
thinking块里,默认display: "omitted"会让文本为空。需要展示进度时,参考指南中的"summarized"或 beta"updates";工具循环仍须原样回传思考块。 - 按平台迁移 computer use。 Claude API 和 Google Cloud 要使用
computer_toolset_20260801,不能继续传computer_20251124;Amazon Bedrock 仍支持旧工具。 - 处理拒答与模型切换。 HTTP 200 配合
stop_reason: "refusal"不代表任务成功。切回 Opus 5 也不能保留 5.5 的思考;Claude API 上的 Fable 5.1、Mythos 5.1 是文档列出的可读取例外。
下面是 Anthropic 直连 API 最小示例,需要 Anthropic Key,不使用 OmniaKey Key。示例依据公开文档编写,本次没有执行付费请求。
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5-5",
"max_tokens": 4096,
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "请审查这份迁移计划并列出三个主要风险。"}]
}'
max_tokens 要同时为思考和可见答案留出空间。客户端应收集 text 类型内容,不能默认 content[0] 就是回答。
哪些用户值得升级?在哪里可以使用?
Opus 5 用户可以先测试复杂重构、难以复现的 bug 和失败成本高的任务。固定工具、权限与验收条件,对比 medium 和 high,记录成功率、重试、token、耗时及人工修正时间。跨模型对照尽量使用新会话。
Sonnet 用户不必把所有短任务都迁走,只有减少的重试或审核时间能抵消费率差时才升级。Fable 用户可验证 5.5 是否以更低价格达到相同验收要求;发布榜单不能替代自己的质量门槛。
官方列出的使用入口包括 Claude、Claude Code、Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud 和 Microsoft Foundry。账号额度、区域与计费条款以各平台为准。本文没有确认 OmniaKey 的 Opus 5.5 实时路由;接入网关前请在当前模型目录核对准确 ID 和价格。
常见问题
Opus 5.5 什么时候发布?
2026 年 9 月 22 日已正式发布,直连 API 模型 ID 为 claude-opus-5-5,不再是未确认传闻。
Opus 5.5 API 价格是多少?
每百万 token 普通输入 $4、输出 $20、缓存读取 $0.20。5 分钟与 1 小时缓存写入分别为 $5 和 $8。订阅套餐额度另算。
Opus 5.5 编程比 Opus 5 强吗?
Anthropic 公布的编程评测中 5.5 更高,token 单价也更低。它值得优先测试,但迁移前仍需验证工具循环和真实验收任务。
可以关闭 thinking 吗?
不能。Adaptive thinking 始终开启;想降低成本或延迟,应降低 effort 并检查任务质量。
百万上下文等于不限量使用吗?
不等于。它是容量上限,不是免费额度,输入、输出、缓存、工具及账号限流依然生效。