Claude Sonnet 5.5 评测
更快的日常模型,但真正需要关注的是它带来的 API 合同变化。
Claude Sonnet 5.5 是 Anthropic Claude 5.5 家族里更适合日常工作的升级。 它在 2026 年 9 月 28 日发布,标准 API 单价与 Sonnet 5 相同,但 Anthropic 表示生成速度提升 30% 以上,单个任务的成本最高可降低 30%,原因是完成同一工作所需的 Token 更少。公开的编程和知识工作成绩也明显靠近 Opus 5.5。
这并不意味着 Sonnet 5.5 可以替代 Opus。它更适合边界清楚的功能开发、修复可复现的 Bug、制作文档和表格,以及需要快速迭代的 Agent。对开发者来说,更容易踩坑的地方是 API 合同:如果原来的 Sonnet 5 客户端使用了关闭 thinking、强制工具调用、旧 computer use 工具或只读取 content[0],改模型名之前就应该先做迁移测试。
核对日期:2026 年 9 月 29 日。 本文依据 Anthropic 发布公告和 Claude Platform 当前文档。下文的基准分数、速度和成本宣传均为 Anthropic 公布的结果,我们没有运行独立的付费基准或延迟测试。示例费用按 Anthropic 直连 API 的全球标准价格计算,并固定 Token 数量。
Claude Sonnet 5.5 规格速览
| 项目 | Claude Sonnet 5.5 |
|---|---|
| 发布日期 | 2026 年 9 月 28 日 |
| Claude API 模型 ID | claude-sonnet-5-5 |
| 上下文窗口 | 1M Token |
| 标准最大输出 | 128K Token |
| 输入 / 输出 | 每百万 Token $2 / $10 |
| 缓存写入 / 读取 | 每百万 Token $2.50 / $0.20 |
| Thinking | 默认 Adaptive |
| 默认 effort | high |
| 相对延迟 | Fast |
| 可靠知识截止 | 2026 年 6 月 |
| 输入与输出 | 文本、图片 → 文本 |
模型已在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS 提供。不同平台的模型 ID 可能不同,生产切换前应看对应平台的可用性表。同步 Messages 请求的上限是 1M 上下文和 128K 输出;Batch API 在相应 Beta Header 下可到 300K 输出,这是另一套限制。
相比 Sonnet 5 到底提升了什么?
Anthropic 的第一条宣传是生成速度提升 30% 以上。第二条是单任务成本最高降低 30%。Token 单价没有打折,节省来自更少的输出 Token、更少的工具步骤和更有效的执行。
下面是 Anthropic 公布的 Sonnet 5.5 与 Sonnet 5 对比:
| 评测 | Sonnet 5.5 | Sonnet 5 | 测什么 |
|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 多步骤终端编程 |
| CursorBench 4.0 | 55.5% | 34.1% | 模糊的编程 Agent 任务 |
| GDPval-AA v2.1 | 1844 | 1449 | 跨职业知识工作 |
| AA-Briefcase v1.1 | 1811 | 1359 | 长周期知识工作 |
| Humanity’s Last Exam | 64.5% | 54.9% | 带工具的多学科推理 |
| OSWorld 2.1 | 80.1%(partial) | 57.0%(partial) | Computer use |
| Chartography | 61.6% | 15.6% | 图表视觉识别 |
这些数字适合当作测试信号,不能直接当成你的仓库成功率。Sonnet 5.5 的 CursorBench 为 55.5%,接近 Opus 5.5 的 57.8%;GDPval 也接近 Opus 5.5 的 1846。Anthropic 仍然认为 Opus 在开放式、需要持续判断的复杂工作上更强。合理的解读是:Sonnet 5.5 缩小了很多重复性任务的差距,但没有消除保留升级模型的必要。
Anthropic 的成本图还把 effort、工具和完成一项任务所需的总 Token 放在一起比较。低 effort 下就能通过验收的 Sonnet 5.5 可能非常划算,高 effort 或多次重试时未必如此。比较时固定提示词、工具权限、仓库版本和验收测试,再与 Opus 5.5 模型页 的信息对照。
API 价格没有改变
Sonnet 5.5 沿用 Sonnet 5 的 Anthropic 直连价:
| 计费项 | 价格 |
|---|---|
| 未缓存输入 | 每百万 Token $2 |
| 输出(含计费的 thinking Token) | 每百万 Token $10 |
| 5 分钟缓存写入 | 每百万 Token $2.50 |
| 1 小时缓存写入 | 每百万 Token $4 |
| 缓存读取 | 每百万 Token $0.20 |
| Batch API 输入和输出 | 5 折 |
假设一个未缓存任务使用 100K 输入 Token 和 20K 输出 Token,直连费用是 0.1 × $2 + 0.02 × $10 = $0.40。如果其中 80K 输入命中缓存,同样数量的 Token 是 0.02 × $2 + 0.08 × $0.20 + 0.02 × $10 = $0.376,还要另算最初的缓存写入。真实 Agent 费用还会受到 thinking Token、工具调用、重试次数和轮数影响。
因此,“单任务最高便宜 30%”不等于“每张账单打 7 折”。更有用的指标是每个通过验收的改动成本:把输入、缓存、输出和工具费用除以最终通过测试或人工审核的结果。OmniaKey 的网关报价是另一套价格,预算前请查看最新的模型目录。
从 Sonnet 5 迁移会破坏哪些客户端?
模型 ID 可以直接换成 claude-sonnet-5-5,请求设置却不能全部照搬。
- Thinking 默认是 Adaptive。 可以省略
thinking,或发送{"type":"adaptive"}。要关闭前置思考,使用thinking: {"type":"between_tools"}。旧的{"type":"disabled"}和手动budget_tokens会返回 400。 - 不支持强制工具调用。
tool_choice: {"type":"any"}和{"type":"tool"}会报 400。使用auto或none;需要严格参数时,用 strict 工具定义或 structured outputs。 - Thinking block 不能随意跨模型传递。 Sonnet 5.5 可以读取 Sonnet 5 的 thinking block,但 Opus 5 和 Opus 5.5 不能读取 Sonnet 5.5 产生的 block。中途切换模型时,下一次请求看到的上下文可能不同。
- 修改历史后要重新检查绑定。 对启用较新绑定检查的账号,如果修改了旧的 system、tool 或消息,再重放原 thinking block,可能返回 400。优先追加新指令,并按官方 block-binding 方案处理。
- 按平台升级 computer use。 Claude API 和 Google Cloud 需要
computer_toolset_20260801;Amazon Bedrock 仍接受旧的computer_20251124。这会影响工具循环,不只是改名字。 - 按 block 类型解析流式响应。 工具调用之间的进度文本可能以
thinkingprogress-update block 返回。只渲染text的客户端会看起来像卡住了,实际请求可能已经成功。
一个最小的 Adaptive 请求可以写成:
{
"model": "claude-sonnet-5-5",
"max_tokens": 4096,
"output_config": {"effort": "high"},
"messages": [
{"role": "user", "content": "请审查这次迁移并列出三个最大风险。"}
]
}
不要在没有核对新文档的情况下继续使用非默认的 temperature、top_p 或 top_k;当前 Sonnet 5.5 接口会拒绝这些参数。max_tokens 需要同时给思考和可见答案留下空间。
它适合放进什么工作流?
可以先用 Sonnet 5.5 做范围清晰的功能、可复现的 Bug、围绕已有接口写测试、局部 Code Review、文档或幻灯片初稿,以及高频 Agent 步骤。仓库有测试、类型检查、构建或截图验收时,便宜模型更容易快速证明自己够用。
如果任务横跨多个服务、要求不可逆的架构决定,或者上下文和需求本身都不完整,先提高 effort 或升级到更强模型。Sonnet 已经读到正确文件、认真尝试仍然找不到根因,这是能力问题;如果只是没有验收、提示词含糊或环境缺日志,先补上下文更有效。
在 Claude Code 里固定模型和验收标准。用相同仓库状态、权限和提示词分别开新会话,记录首次有用输出的时间、总耗时、计费 Token、重试、失败工具调用和人工修复分钟数。每个 Token 更快,不代表整个交付一定更快。
结论
Claude Sonnet 5.5 值得成为日常编码和知识工作的首个测试默认值。 单价不变、公开任务成本下降、生成更快,而且相对 Sonnet 5 的公开基准提升很大,边界明确的工作迁移理由充分。
但不要只替换模型字符串就上线。先测试 thinking、tool choice、响应 block 解析和 computer use 路径。把 Opus 5.5 留给模糊架构、困难调试和高后果判断,再用实际的通过率、总费用和修改时间决定哪些任务长期留在 Sonnet 5.5。需要在 Opus 5.5 和 Sonnet 5.5 之间选型时,可以继续看 Opus 5.5 与 Sonnet 5 对比。
常见问题
Claude Sonnet 5.5 什么时候发布?
Anthropic 于 2026 年 9 月 28 日发布,直连 Claude API 的模型 ID 是 claude-sonnet-5-5。
Sonnet 5.5 比 Sonnet 5 便宜吗?
公开 Token 单价相同:输入每百万 Token $2,输出每百万 Token $10,缓存读取每百万 Token $0.20。Anthropic 宣称单任务最高便宜 30%,原因是新模型通常使用更少 Token 和工具步骤。
Sonnet 5.5 比 Opus 5.5 强吗?
没有统一答案。Sonnet 5.5 对范围明确的工作更快、更便宜;Opus 5.5 仍适合复杂、开放式判断。应在自己的验收任务上比较结果、总成本和人工修正时间。
可以关闭 Sonnet 5.5 的 thinking 吗?
不能使用旧的 thinking: {"type":"disabled"}。可以使用默认的 Adaptive,或在支持的 effort 范围内使用 thinking: {"type":"between_tools"} 关闭前置思考。
Sonnet 5.5 有 1M 上下文吗?
有。规格列出 1M Token 上下文和 128K 标准最大输出。这是容量上限,不是赠送用量,也不代表无限额度。