GPT-6.1 Sol 評価
性能と総コストから乗り換えを判断。
GPT-6 Solで複雑な開発や繰り返しの修正を行っているなら、GPT-6.1 Solは優先して比較したい候補です。 標準の入力・出力単価は据え置き、キャッシュ読み取り単価は半額になりました。OpenAIの公表評価でも改善が見られます。ただし、調査が難しい仕事や修正の手戻りが高くつく仕事では、Astraも比較対象に残すのが妥当です。
単価と、仕事を完了するまでの費用は別です。公式のコーディング評価には、新Solの得点が大きく上がる一方、タスク当たりの費用は旧Solより少し増えた例もあります。この違いを押さえると、乗り換えの判断が具体的になります。
資料確認日:2026年9月30日(UTC)。 公式文書と出典を明示した評価結果に基づくレビューです。当サイトによる独立したモデル比較テストは行っていません。料金例は仮定したトークン数による計算です。OmniaKeyは本記事の発行元でありAPIゲートウェイの提供者ですが、その料金とOpenAI直販APIの料金は区別します。
GPT-6.1 Solで何が変わったか
公式API更新履歴による公開日は2026年9月29日。モデルIDは gpt-6.1-sol です。複雑なコーディング、コンピューター操作、専門業務を、Astraより低い費用で処理する位置づけです。
| 項目 | GPT-6.1 Sol |
|---|---|
| コンテキストウィンドウ | 1,050,000トークン |
| 最大出力 | 128,000トークン |
| ネイティブ入力 / 出力 | テキスト・画像 / テキスト |
| APIの推論強度 | low、medium(既定)、high、xhigh、max |
| ツール呼び出し用API | Responses |
新Sol、旧Sol、Astraの容量は同じです。今回はウィンドウの拡大ではありません。出力や推論もコンテキストを使い、同じ容量でも情報の取り出し精度が同じとは限りません。このモデルは音声・動画をネイティブには扱いません。
コーディング性能は同じ推論強度で比べる
OpenAIの発表のDeepSWE v1.1グラフから、3モデルとも medium の値を取り出しました。実在するコードベースでの複雑なソフトウェア開発を評価した結果です。費用は発表元の測定値であり、当サイトの実測や後述の料金試算とは異なります。
モデル(medium) | DeepSWE v1.1得点 | 平均タスク費用 |
|---|---|---|
| GPT-6.1 Sol | 73.0% | $0.42 |
| GPT-6 Sol | 56.6% | $0.38 |
| GPT-6 Astra | 72.8% | $3.08 |
この条件では、新SolはAstraに近い得点をかなり低い費用で出しています。ただし0.2ポイントの差から、全般的な優位性や統計的有意差を主張することはできません。旧Solとの比較では、標準単価は同じでもタスク費用は$0.38から$0.42へ増えています。実際の使用量まで見る必要があります。
推論を増やせば得点が上がるとも限りません。新Solは high で75.2%/$0.65、max で71.9%/$1.57 です。発表文の「6.4ポイント改善」は新Solの high と、旧Solの最高値である max の68.8%を比べたものです。両方の medium の差ではありません。
ほかの公式評価では、AutomationBench 1.0.6の medium が旧Sol比で4.8ポイント改善しています。OSWorld 2.0のv2026.08.08オフライン集合では、max の部分報酬が旧Solより7ポイント高く、Astra同設定との差は2.1ポイントです。部分報酬を、そのままあらゆるPC作業の完了率と解釈しないようにしましょう。
英語発表文の事実性評価では、意図的に選ばれた難しい会話で「少なくとも一つ事実誤りを含む回答」の割合が low で**11.4%から7.7%に下がりました。日常利用全体の誤り率ではありません。一方、同発表のTerminal-Bench Science 0.1ではAstraの max が68.1%**で最高でした。新Solを試す根拠はありますが、すべての業務からAstraを外す根拠にはなりません。
API料金とキャッシュ費用
以下は公式料金表に基づく、入力272Kトークン以下のOpenAI直販Standard料金、100万トークン当たりの米ドルです。サブスクリプションの利用枠、ゲートウェイ料金、ツール費用や税は別です。
| 課金区分 | GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
| キャッシュ外の入力 | $2.00 | $2.00 | $10.00 |
| キャッシュ読み取り | $0.10 | $0.20 | $1.00 |
| キャッシュ書き込み | $2.50 | $2.50 | $12.50 |
| 出力 | $10.00 | $10.00 | $50.00 |
旧Solから下がったのは、この4項目のうち読み取りだけです。Astraに対して標準入力・出力は5分の1、読み取りは10分の1。タスク全体の請求額が同じ比率になるとは限りません。
同じ使用量で計算すると
Kは1,000トークンで、出力には課金対象の推論を含みます。3モデルの数量を同じに固定した試算です。読み取り行だけは有効なキャッシュへの命中を仮定し、それ以前の書き込みは別料金とします。ツール、実行環境、税、ゲートウェイ費用は含めません。
| 仮定する使用量 | GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
| キャッシュ外入力100K+出力10K | $0.30 | $0.30 | $1.50 |
| 初回書き込み200K+キャッシュ外入力20K+出力10K | $0.64 | $0.64 | $3.20 |
| 読み取り200K+キャッシュ外入力20K+出力10K | $0.16 | $0.18 | $0.90 |
| キャッシュ外入力300K+出力10K、長文料金 | $1.35 | $1.35 | $6.75 |
読み取り行の新Solは 0.20 × $0.10 + 0.02 × $2 + 0.01 × $10 = $0.16。旧Solは$0.18なので、**読み取り単価が50%下がっても、このリクエスト全体の節約は11.1%です。初回書き込み1回と同じ読み取り10回なら$2.24対$2.44、約8.2%**の節約になります。共通部分が有効で、10回すべて命中した場合の計算です。
キャッシュ文書では、書き込み料金は通常入力への追加料金ではないと説明されています。同じトークンを二重計上せず、通常入力・読み取り・書き込みに分けて計算してください。
272Kを超えるとリクエスト全体が加算対象
入力が272Kを超えると、リクエスト全体の入力とキャッシュ単価が2倍、出力単価が1.5倍になります。キャッシュ入力も長さに含まれます。新Solの300K例は 0.30 × $4 + 0.01 × $15 = $1.35 です。
推論トークンも出力として課金されます。Fastの単価はStandardの2倍、BatchとFlexは半額ですが、価格倍率から完了時間は推測できません。ツール待ちや再試行も記録しましょう。
移行前に確認する3項目
GPT-6ガイドに沿って、既存Agentのリクエストを確認します。
- 推論設定。 旧Solは
noneに対応しますが、新Solはnoneとminimalに非対応です。対応する設定へ変更して使用量と待ち時間を確認します。API既定値はmediumでも、クライアントの既定値は別に確認が必要です。 - ツールのAPI。 旧SolのChat Completionsでの関数呼び出しは
reasoning_effort: "none"の場合に限られます。新Solのツール呼び出しにはResponsesを使います。ツールなしのChat Completionsは利用できます。 - サンプリング設定。 推論有効時は
temperatureやtop_pなど非対応の設定を除去します。SDKやゲートウェイによる自動挿入も確認してください。
Codex CLIでの公式の選択方法は次のとおりです。
codex --model gpt-6.1-sol
対話セッション内では /model を使います。これは文書に基づく案内であり、本記事でアカウント経由の呼び出しを実行したわけではありません。
利用できるプランと画面
Codexのモデル案内では、公開時の対象はPlus、Pro、Business、Enterprise、Eduの該当するWork/Codex環境です。EnterpriseとEduでは管理者の有効化が必要で、FreeとGoは初期展開の対象外。ChatGPTでは公開時点で通常のChatではなくWorkとCodexに提供されます。速度モードはアカウント、クライアント、ワークスペースで確認してください。
サブスクリプションとcreditsはAPI料金とは別です。Codex creditsには独立したキャッシュ書き込み料金がありません。上の試算からプラン内で実行できる回数を約束することはできません。
既定モデルにする前の小さな検証
旧Solユーザーなら、同じ標準単価と公表性能の改善を理由に移行テストを始める価値があります。Astraユーザーは、頻繁に実行し、結果を明確に検査できる業務から比較すると判断しやすくなります。
提案する試験は、再現済みのバグ2件、複数ファイルの変更2件、根拠を確認できる文書質問2件です。各モデルで各タスクを3回、作業環境を初期化して実行します。入力、ツール、権限、再試行上限を揃え、まず全モデルを明示的な medium で比較。設定を調整した試験は別に報告します。本記事ではこの試験を実行していません。
合否、見落とし、所要時間、課金トークン、失敗、手修正を記録し、全試行の費用を合格件数で割ります。成功がなければ「合格なし」と記録します。小さな試験から一般的な成功率は導けません。
旧版の背景はGPT-6 Solレビューと旧SolとAstraの比較を参照してください。OmniaKeyで表示中の経路と料金はモデル一覧で確認できます。公式公開だけで各ゲートウェイの利用可否は判断できません。本文のOpenAI資料へのリンクは英語です。