Claude Fable 5 和 GPT-5.6 Sol 编程对比
最困难的长程 Agent 任务先测试 Fable 5;工作流以 Codex、Responses 和 OpenAI 工具链为核心时,先测试 GPT-5.6 Sol。
Claude Fable 5 和 GPT-5.6 Sol 编程对比面对的是两款边界不同的顶级模型。任务极难、周期很长,而且值得为更高完成率支付溢价时,先测试 Claude Fable 5;工作流围绕 Codex、OpenAI Responses、结构化输出或 OpenAI 托管工具构建时,先测试 GPT-5.6 Sol。
两者都不是普遍赢家。目前没有公开受控实验,把 Fable 5 与 Sol 放进同一个编程 Agent,并对齐工具、提示词、effort、权限和仓库任务。可靠的选择标准应是:谁能用更少失败、更少人工返工和可接受的总成本通过同一套验收。
**事实核验于 2026 年 8 月 13 日。**规格、价格、访问条件、拒绝行为和工具支持来自 Anthropic、OpenAI 当前官方文档及 OmniaKey 在线模型目录。我们没有运行私有的受控正面对比,因此本文给出的是路由原则与评测方法,不虚构通用性能排名。
Fable 5 与 GPT-5.6 Sol 快速结论
| 决策 | 先用 Claude Fable 5 | 先用 GPT-5.6 Sol |
|---|---|---|
| 最困难的长程 Agent 任务 | 是 | 若工作流原生使用 Responses,也应测试 |
| Codex 原生仓库工作 | 不是 Codex 原生模型 | 是 |
| Claude Code 原生工作流 | 是,前提是 provider 提供 Fable | 不是 Claude 模型 |
| 推理控制 | adaptive thinking 始终开启 | reasoning effort 支持 none 到 max |
| 上下文容量 | 1,000,000 token | 1,050,000 token |
| 最大输出 | 128,000 token | 128,000 token |
| 官方短上下文输入 / 缓存 / 输出价 | $10 / $1 / $50 | $5 / $0.50 / $30 |
| 当前 OmniaKey 输入 / 缓存 / 输出价 | $2 / $0.20 / $10 | $0.35 / $0.035 / $2.10 |
| 特殊运营边界 | refusal 与 30-day data retention | 输入超过 272K 后长上下文加价 |
| 独立、通用的编程冠军 | 尚未证实 | 尚未证实 |
一句话总结:特殊高难任务考虑 Fable,OpenAI 前沿工作流考虑 Sol。普通困难任务如果用 Opus、Terra 或其它便宜模型也能通过,就应选择成本更低的已验收结果。
比较的是模型,不是 Agent 品牌
Fable 5 和 Sol 是模型。Claude Code 与 Codex 是编程 Agent,决定模型能看到哪些仓库上下文、可以调用什么工具、如何接收错误,以及何时停止执行。
这个区别会直接改变比较方式:
- Fable 5 使用 Anthropic 原生 Messages 协议,与 Claude 工具链自然匹配;
- Sol 使用 OpenAI API,是 Codex 和 Responses 工作流中的 GPT-5.6 旗舰模型;
- 网关可以同时提供两个模型,但不会让 provider 原生工具和 Agent 行为自动相同;
- 一次模型 API 调用成功,不代表某个编程 Agent 的权限、工具或版本已经正确配置。
Anthropic 原生接入见 Claude Code API 指南,Responses 兼容接入见 Codex CLI 指南。Claude 家族内部选型由 Claude Code 最佳模型指南负责,GPT-5.6 家族内部选型由 Codex 的 GPT-5.6 模型指南负责。
规格与 API 价格
| 规格 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|
| 准确模型 ID | claude-fable-5 | gpt-5.6-sol |
| 官方定位 | 最强的广泛发布 Claude | GPT-5.6 旗舰档 |
| 上下文窗口 | 1,000,000 | 1,050,000 |
| 最大输入 | 在 1M 上下文限制内 | 922,000 |
| 最大输出 | 128,000 | 128,000 |
| 输入模态 | 文本、图像 | 文本、图像 |
| 原生 API | Anthropic Messages | OpenAI Responses 与 Chat Completions |
| 官方输入 / 缓存 / 输出价 | $10 / $1 / $50 | $5 / $0.50 / $30 |
| 当前 OmniaKey 输入 / 缓存 / 输出价 | $2 / $0.20 / $10 | $0.35 / $0.035 / $2.10 |
以上均为每百万 token 的美元价格。Fable 的 $1 是标准 cache read 价格,创建缓存另行计费。Sol 表内是短上下文价格;输入超过 272K 时,OpenAI 当前会对整次请求按 2 倍输入价和 1.5 倍输出价计费,Sol cache write 为未缓存输入价的 1.25 倍。
当前平台价不是永久折扣承诺,也不会改变两家厂商的官方标价。制定生产预算前,请检查两个模型页与在线模型目录。Fable 的详细计费算例与访问条件由 Fable 5 API 价格指南负责。
何时先选 Fable 5
Anthropic 把 Fable 5 定位为最强的广泛发布模型,用于最苛刻的推理和长程 Agent 工作。出现以下信号时,适合先做 Fable 受控测试:
- 任务可能需要长时间调查与大量工具轮次;
- 收集证据之前无法预先知道正确方案;
- 架构、安全、账务或持久数据让错误方案代价很高;
- Agent 必须经历压缩和中间状态变化后仍保持目标;
- 更便宜的模型已经在同一验收测试中出现可诊断失败;
- 受支持的 Anthropic surface 上需要 task budgets、memory、code execution 或 programmatic tool calling。
Fable 不适合默认处理每一个 PR。其官方输入和输出价格分别是 Opus 5 的两倍,OmniaKey 当前价格也保持相同的二比一边界。应把溢价留给定义清楚的升级任务,而不是拿它补偿模糊需求和缺失测试。
Fable 5 的 adaptive thinking 始终开启。可以通过 effort 控制深度,但不能关闭 thinking。评估时要记录完整任务,因为推理与工具循环可能远比可见答案昂贵。
何时先选 GPT-5.6 Sol
OpenAI 把 Sol 定位为处理复杂专业工作的 GPT-5.6 旗舰模型。以下场景更适合从 Sol 开始:
- 已经确定使用 Codex;
- 应用已经基于 Responses API;
- structured outputs 或 function calling 是验收 contract 的一部分;
- 需要 OpenAI 托管的 web search、file search、code interpreter、hosted shell、computer use、MCP 或 tool search;
- 团队需要从 none 到 max 的明确 reasoning effort 档位;
- 通过验收后还要在同一 harness 上与 Terra 或 Luna 比较。
gpt-5.6 alias 当前指向 gpt-5.6-sol,但保存评测与自动化时应使用准确 ID。Alias 可能变化,准确 ID 才能记录实际测过的模型。
provider 原生工具是否可用取决于实际 surface。支持 Responses 的自定义 endpoint 不会自动复制 OpenAI 托管工具或 ChatGPT 功能。必须测试计划投入生产的 provider、账号、Agent 版本与权限模式。
公开证据不能证明什么
厂商资料能证明定位、规格、价格和支持的功能,但不能证明跨厂商通用冠军。
公平的对比至少要求两个模型:
- 从同一个仓库 commit 开始;
- 使用同一任务描述与验收标准;
- 拥有等价的文件、shell、网络与工具权限;
- 记录 effort 与 token budget;
- 重复多次,而不是挑一段漂亮 transcript;
- 对补丁与验证结果做盲评。
目前没有这样的 Fable 5 与 Sol 公共实验。厂商 benchmark、Agent leaderboard 和模型 API 测试回答的不是同一个问题,只能解释各自的配置。
已有的日常旗舰对比见 Claude Opus 5 和 GPT-5.6 Sol 编程对比。本文的问题更窄:Fable 的专业档溢价,相比 OpenAI 旗舰 Sol 路线何时值得支付。
一个代表性任务要多少钱
假设一次验收成功的尝试使用 100,000 个未缓存输入 token 和 20,000 个输出 token。该任务低于 Sol 长上下文阈值,并排除 cache write、付费工具、重试与税费。
| 路线 | 输入 | 输出 | 总计 |
|---|---|---|---|
| Anthropic 官方 Fable 5 | $1.00 | $1.00 | $2.00 |
| OpenAI 官方 Sol | $0.50 | $0.60 | $1.10 |
| 当前 OmniaKey Fable 5 | $0.20 | $0.20 | $0.40 |
| 当前 OmniaKey Sol | $0.035 | $0.042 | $0.077 |
这只是价格计算,不是质量 benchmark。如果 Sol 需要多次失败尝试或留下昂贵人工修复,Fable 的单次验收成本仍可能更低;如果两者完成率、延迟和修正量接近,Sol 更便宜。
完整指标应是:
completed-task cost = 成功执行费用
+ 失败尝试与重试
+ 工具和缓存写入
+ 人工修正时间
+ 错误变更的代价
长上下文会改变价格比较
两个上下文窗口看起来接近,但计费规则并不相同。
Fable 提供 1M token 上下文,并按自身标准模型价格计费。Sol 提供 1,050,000 token 窗口、最大输入 922,000;一旦输入超过 272K,OpenAI 的长上下文价格会作用于整次请求。
不要因为窗口存在就把它填满。仓库地图、定向搜索、检索、缓存友好的提示词和精简工具结果,往往比发送全部文件更能保留有效证据。低于和高于 Sol 阈值的工作负载必须分开评测。
可能直接决定选择的运营差异
Fable 的拒绝机制
Fable 5 带有安全分类器。被拒绝的 Anthropic Messages 请求可能返回 HTTP 200 和 stop_reason: "refusal"。必须显式处理,不能把它当作成功的编程答案,也不能无限盲目重试。
Anthropic 提供 server-side、client-side 与 manual fallback。输出前被拒绝的请求不收费,fallback credit 可覆盖符合条件的重复 prompt-cache 成本;实际 provider 行为仍需验证。
Fable 的数据保留
Anthropic 说明 Fable 5 采用 30-day data retention,并且不支持 zero data retention。对于敏感仓库,这一点可能在能力与价格比较前就排除 Fable。发送私有代码前要审查仓库敏感度与实际 provider 条款。
Sol 的上下文和工具边界
Sol 需要预算输入超过 272K 后的倍率,以及单独收费的托管工具。还要确认当前 route 实际提供哪些工具;Responses 兼容本身不等于 OpenAI 托管 surface 的完整功能。
可复现的编程评测
建立一组能代表专业档决策的任务:
- 一个有已知根因的跨服务 bug;
- 一个带隐藏约束的高风险 migration;
- 一个需要 checkpoint 与验证的长实现任务;
- 一个植入已知缺陷的安全 review;
- 一个普通功能,用来判断两款模型是否都过度配置。
每次运行记录:
- 准确 model ID 与 provider;
- Agent 与版本;
- effort 与 token budget;
- 仓库 commit 和干净起点;
- 权限与可用工具;
- 耗时、token、重试和工具费用;
- 验收命令与人工修正分钟数。
每个任务都应重复。评分对象是通过验收的产物,不是解释是否流畅。若两者都通过,选更便宜、更简单的路线;若只有 Fable 能稳定完成特殊任务,就把它保留为升级档;若 Sol 在 Codex 工作流中获胜,就在该工作流内标准化,不要外推到所有 Agent。
实用路由表
| 任务信号 | 从这里开始 | 下一步实验 |
|---|---|---|
| 最困难、长程、Claude 原生任务 | Fable 5 | 与 Opus 5 对比,证明溢价 |
| 复杂 Codex 或 Responses 原生任务 | GPT-5.6 Sol | 通过后与 Terra 对比 |
| 敏感代码要求 zero data retention | 不要默认 Fable 合适 | 核验符合要求的模型与 provider |
| 普通日常功能 | 默认都不用 | 测试 Opus、Sonnet、Terra 或其它便宜档 |
| 未知高风险任务 | Fable 与 Sol 做匹配测试 | 为该任务类型保留赢家 |
模型路由应是有证据的策略,而不是固定品牌偏好。
最终结论
任务确实特殊、周期很长、难以拆解、做错代价很高,而且能接受 Fable 的拒绝与数据保留边界时,先选 Claude Fable 5。
工作流由 Codex、Responses、structured outputs、OpenAI 工具或 GPT-5.6 生态决定时,先选 GPT-5.6 Sol。无论官方价还是 OmniaKey 当前价格,Sol 的 token 单价也更低。
普通困难编程不能靠专业档名称证明价值。标准化昂贵路线前,先用同一仓库验收测试一个更便宜的模型。
常见问题
Claude Fable 5 编程能力是否强于 GPT-5.6 Sol?
目前没有匹配 Agent、工具与任务的受控实验能证明通用赢家。Anthropic 最困难的长程 Agent 工作适合先测 Fable;前沿 Codex 和 Responses 工作流适合先测 Sol。
Fable 5 与 GPT-5.6 Sol 哪个更便宜?
Sol token 单价更低。官方短上下文价格中,Sol 每百万 token 为 $5 输入、$0.50 缓存输入、$30 输出;Fable 为 $10、$1、$50。若重试和人工修正不同,完整任务成本可能变化。
谁的上下文窗口更大?
Sol 是 1,050,000,Fable 是 1,000,000。Sol 最大输入为 922,000,输入超过 272K 后使用更高长上下文价格。容量不等于有效上下文,也不等于免费额度。
Fable 5 能在 Codex 中运行吗?
Fable 是 Anthropic 模型,不是 Codex 推荐原生模型。Codex 可以在支持的 API contract 下连接兼容 provider,但模型可访问不等于复现 Claude Code 行为或 Anthropic 托管功能。
GPT-5.6 Sol 能在 Claude Code 中运行吗?
Claude Code 围绕 Claude 模型与 Anthropic 协议设计。使用 Sol 时,应选择 Codex 或支持相应 OpenAI-compatible route 的客户端,不要把跨协议变通当成常规路径。
Fable 5 是否始终使用 adaptive thinking?
是。Anthropic 说明 Fable 5 的 adaptive thinking 始终开启,可用 effort 控制深度,但不能关闭。
团队选择前应该测试什么?
固定 commit、提示词、权限、工具、effort budget 与验收命令。重复执行并比较通过率、耗时、完整账单、重试和人工修正。
核验来源
- Anthropic:Claude Fable 5 与 Claude Mythos 5
- Anthropic API 价格
- OpenAI:GPT-5.6 Sol
- OpenAI API 价格
- OpenAI:Codex 模型
- OmniaKey 在线模型目录
事实核验于 2026 年 8 月 13 日。模型访问、价格、工具支持、数据条款和 provider 规则都可能变化,生产决策前请检查官方文档与在线目录。