Claude Code 最佳模型
日常编码先用 Sonnet 5,复杂工作升级到 Opus 5,窄而明确的辅助任务交给 Haiku 4.5,只有其它模型无法完成时才使用 Fable 5。
多数日常仓库工作中,Claude Code 最佳模型是 Claude Sonnet 5。它响应快、原生支持 100 万 token 上下文,并且 token 单价低于 Opus 和 Fable。遇到模糊的架构问题或错误代价很高的任务时升级到 Claude Opus 5;范围窄、验收标准明确的辅助任务用 Claude Haiku 4.5;最难且需要长时间自主推进的调查再使用 Claude Fable 5。
这是一套起始路由策略,并不是适用于所有仓库的排行榜。真正的选择同时取决于任务和 effort。更强的模型提供更高的能力上限;更高的 effort 会让当前模型在返回前读取更多文件、执行更多步骤并做更多验证。
事实核查日期:2026 年 8 月 2 日。 本文依据 Anthropic 当前的模型、Claude Code 配置、成本和 subagent 文档,以及 OmniaKey 实时模型目录。我们没有做四模型受控 benchmark,因此下面给出的是可复现的路由策略,而不是“某个模型在所有仓库都获胜”的结论。
Claude Code 最佳模型速查
| 模型 | 在 Claude Code 中最适合 | 上下文 | Anthropic 输入 / 输出 | OmniaKey 输入 / 输出 |
|---|---|---|---|---|
| Claude Sonnet 5 | 日常编码、功能开发、常规调试、多数 subagent | 1M | 首发期 $2 / $10;之后 $3 / $15 | $0.60 / $3 |
| Claude Opus 5 | 架构、隐蔽 bug、大型重构、高代价故障 | 1M | $5 / $25 | $1 / $5 |
| Claude Fable 5 | 最难、持续时间最长的自主工作 | 1M | $10 / $50 | $2 / $10 |
| Claude Haiku 4.5 | 快速搜索、分类、摘要、小型机械任务 | 200K | $1 / $5 | $0.20 / $1 |
价格单位均为每百万输入和输出 token 的美元价格,不含 prompt cache 或工具费用。Anthropic 的 Sonnet 5 首发价格持续到 2026 年 8 月 31 日,9 月 1 日起恢复标准价。OmniaKey 一栏是事实核查日网站展示的网关价格,不是 Anthropic 订阅套餐额度。生产预算应先在模型目录核对实时价格。
如果今天只采用一条规则:默认用 Sonnet 5,再按任务升级。最佳模型不是 benchmark 数字最大的型号,而是能稳定交付验收通过改动的最低成本型号。
为什么 Sonnet 5 最适合做日常默认模型
Anthropic 将 Sonnet 5 定位为速度与智能的最佳组合,Claude Code 的成本文档也明确指出 Sonnet 能胜任多数编码任务,并且比 Opus 便宜。它适合:
- 按清晰验收标准实现范围明确的功能;
- 沿少量文件追踪熟悉的错误;
- 在局部改动旁新增或更新测试;
- 审查范围明确的 Pull Request;
- 把已经确定的设计落成代码;
- 通过 subagent 协调常规仓库调查。
Sonnet 5 原生支持 1M 上下文,因此选择它不再意味着放弃当前 Opus 和 Fable 的长上下文能力。但上下文容量不等于能力。100 万 token 可以容纳更多证据,并不能保证模型一定找出正确架构或隐蔽故障。
需要可复现结果时,应使用 OmniaKey 的精确模型 ID:
/model claude-sonnet-5
随着供应商更新推荐版本,Claude 模型别名可能发生变化。当前不带日期的 Claude 5 ID 也是固定快照,因此精确 ID 更适合评测和自动化。
什么时候值得升级到 Claude Opus 5
当任务最昂贵的部分是推理而不是打字时,选择 Claude Opus 5。典型信号包括:
- bug 跨越多个服务,并且最直观的解释是错的;
- 仓库陌生,需求还留下了重要设计选择;
- 架构或迁移决策一旦出错就很难回滚;
- 大型重构必须保留散落在多个文件中的隐式行为;
- 安全、账务或数据完整性问题的修正代价很高;
- Sonnet 已经拿到全部相关上下文并认真尝试,却仍然自信地得出错误结论。
Opus 5 的 token 更贵,但 token 单价不等于完成任务的成本。困难任务中,更强模型可能用更少的失败循环和人工修正交付合格结果。只有一个文件且验收条件精确时,这种优势可能根本没有发挥空间。
/model claude-opus-5
模型的公开证据、effort 行为、迁移注意事项和限制详见 Claude Opus 5 评测。本文只回答在 Claude Code 内如何选模型。
Fable 5 什么时候值得溢价
Claude Fable 5 是 Anthropic 已广泛发布模型中能力最强的一款。Claude Code 文档把它定位为处理“大于一次工作时段”的任务:先调查再行动,能维持很长的自主会话,也比小模型更主动验证结果。
因此 Fable 更像专家型号,而不是日常默认。以下情况值得测试:
- Opus 已认真尝试,根因调查仍然没有结论;
- 工作异常漫长、模糊并且依赖大量工具;
- 故障或架构问题会从更深入的独立调查中明显受益;
- 固定评测集证明 Fable 能完成便宜模型无法完成的任务。
不要只因为仓库文件多就支付 Fable 溢价。清晰范围、聚焦上下文和可靠计划往往比模型尺寸更重要。只有问题本身触及其它模型的能力上限时,Fable 才体现价值。
/model claude-fable-5
Fable 5 需要 Claude Code v2.1.170 或更高版本。模型选择器是否显示它还可能取决于供应商和组织权限;网关也可以暴露已配置的自定义模型选项。
Haiku 4.5 适合放在哪里
Claude Haiku 4.5 是本次比较中最快的型号,上下文为 200K。任务范围窄、成功条件明确并且错误容易被发现时,它很合适:
- 主智能体开始前查找文件或符号;
- 汇总范围有限的日志或测试输出;
- 按已知分类体系归类 issue;
- 在确定性测试保护下做重复修改;
- 回答上下文中现有代码的聚焦问题。
如果一个小错误会引发多次昂贵重试,Haiku 就不再经济。它遗漏跨文件关系、误解陌生领域或需要反复纠正时应立即升级。
可以在专用轻量 subagent 的 frontmatter 中指定模型:
---
name: quick-researcher
description: Finds files and summarizes evidence for a scoped repository question
model: haiku
---
没有填写 model 时,Claude Code subagent 会继承主会话模型。把范围明确的调查固定为 haiku,可以避免每次委派搜索都按 Opus 或 Fable 的价格计费。普通实现或审查 subagent 更适合从 Sonnet 开始。
模型与 effort 要解决不同问题
模型选择和 effort 不是同一个旋钮。
问题本身太难时换模型。 Claude 已拿到相关文件、工具和说明,也认真调查过,却仍然得出错误结论,此时应从 Haiku 升到 Sonnet、Sonnet 升到 Opus,或 Opus 升到 Fable。
Claude 没有认真完成时提高 effort。 如果它跳过相关文件、重构做到一半就停止、没有运行测试或没有检查结果,更高 effort 可能在不换模型的情况下修正行为。
两者之前先修上下文。 模糊请求、过期的 CLAUDE.md、缺失文档或不可用工具,不能靠消耗更多 token 稳定解决。先给出清晰的成功条件和必要证据。
Anthropic 建议先使用每个模型的默认 effort。Claude Code 的 /effort 不只改变思考时间,还会影响模型读取多少文件、使用哪些工具以及验证得多彻底。更高 effort 可能提高完成率,也会增加延迟和输出 token 成本。
一套可执行的模型路由策略
按任务边界切换,不要每几轮就换一次模型:
- 日常功能和维护工作从 Sonnet 5 默认 effort 开始。
- 小而独立、输出可确定验证的 subagent 使用 Haiku 4.5。
- 模糊度、架构范围或失败代价上升时升级到 Opus 5。
- 只有困难任务或内部评测证明有必要时才使用 Fable 5。
- 困难决策完成、后续执行变成机械工作后再切回 Sonnet。
长会话中切换模型后,下一次响应会在没有已有 cache 的情况下重新读取完整历史,因此可能更慢、更贵。尽量在干净的任务边界切换。开始无关任务时,/clear 通常比把旧会话带到新模型更省钱。
Claude Code 还提供 opusplan:计划模式使用 Opus,执行阶段切换为 Sonnet。这是内置的两段路由,但别名背后的精确版本取决于供应商和网关映射。需要版本可复现时仍应使用精确模型 ID。
用验收通过的改动比较模型
公平的本地评测必须固定仓库状态、提示、工具、权限和验收测试。建立一组能代表实际工作的任务:
| 任务类型 | 示例 | 记录指标 |
|---|---|---|
| 常规修改 | 新增经过验证的字段和测试 | 通过率、延迟、修正时间 |
| 调试 | 复现并修复隐蔽回归 | 根因、重试次数、是否跑测试 |
| 重构 | 跨 package 修改接口 | 漏掉的调用点、构建结果 |
| 审查 | 检查包含已知缺陷的改动 | 有效召回、误报 |
| 架构 | 提出可回滚迁移方案 | 约束覆盖、决策质量 |
| Subagent | 搜索并汇总限定证据 | 准确率、token、响应时间 |
智能体输出有随机性,每个任务至少重复一次。记录验收结果、人工修正分钟数、总耗时、输入 token、cache token、输出 token 和工具调用。token 单价高一倍的模型仍可能有更低的合格任务成本;能通过同一测试的便宜模型才是该任务类型的更好选择。
第一轮对比不要同时改变模型和 effort。先固定默认 effort 比较模型,再对准备采用的模型测试不同 effort。否则无法判断结果来自能力还是执行彻底程度。
在 OmniaKey 上切换模型
接入步骤属于 Claude Code 配置指南。Anthropic 兼容端点配置完成后,用 /model 选择精确 ID:
/model claude-haiku-4-5
/model claude-sonnet-5
/model claude-opus-5
/model claude-fable-5
如果当前型号没有出现,请先升级 Claude Code:Sonnet 5 需要 v2.1.197 或更高版本,Opus 5 需要 v2.1.219 或更高版本,Fable 5 需要 v2.1.170 或更高版本。运行 claude update 后重新打开模型选择器。
OmniaKey 会按请求的模型路由,不会暗中替换、量化或蒸馏。模型可用性仍可能变化;不可用时返回错误,而不是偷偷改跑其它型号。把模型写入自动化之前,先检查实时模型目录。
Claude Code 是为 Claude 模型设计的。如果真正的问题是 Claude、GPT 还是 Gemini,应选择支持对应协议的智能体,不要把非 Claude 模型强塞进 Claude Code。更广的型号问题见编码智能体模型对比,产品选择见 Claude Code vs Codex。
最终建议
对多数开发者来说,Claude Sonnet 5 是 Claude Code 最合适的日常默认模型。它速度快、能力强、比 Opus 或 Fable 便宜,上下文也足以支撑长仓库会话。模糊推理和高代价错误用 Opus 5,范围明确的辅助任务用 Haiku 4.5,只有认真尝试 Opus 后仍无法解决的问题才升级到 Fable 5。
把它当成初始路由策略,最终阈值应由你自己的合格改动数据决定。
常见问题
Claude Code 最佳模型是什么?
多数日常编码默认选 Claude Sonnet 5。复杂架构、隐蔽调试和高代价故障更适合 Claude Opus 5。Fable 5 面向最难的长任务,Haiku 4.5 则适合简单、范围明确的工作。
Claude Code 用 Opus 一定比 Sonnet 好吗?
不是。Opus 在困难和模糊任务上能力更强,Sonnet 在常规工作中更快、更便宜。应比较每个验收通过改动的总成本,而不是让大模型处理所有轮次。
大型仓库都应该使用 Fable 5 吗?
不应该。仓库规模本身不足以证明 Fable 值得。先提供聚焦上下文并测试 Sonnet 或 Opus,只有问题确实漫长、模糊并超过便宜模型能力时再用 Fable。
Claude Code subagent 应该使用什么模型?
范围窄、检查标准明确的搜索、分类和摘要用 Haiku;实现、审查和协调从 Sonnet 开始。只有 subagent 自己的任务也需要高能力时,才继承 Opus 或 Fable。
更高 effort 等于更好的模型吗?
不等于。模型决定能力上限,effort 决定当前模型一轮工作得多彻底。认真尝试仍解决不了时换更强模型;漏掉调查或验证步骤时提高 effort。
Claude Code 能使用 GPT 或 Gemini 吗?
不能。Anthropic 明确把 Claude Code 设计为使用 Claude 模型。需要 GPT 或 Gemini 时应选择 Codex、Cursor、Cline、aider 等兼容智能体。