Jev モデルが統合され提供開始 · ぜひご利用ください
ブログ
ガイド

DeepSeek V4 Flash Vision Exp

DeepSeek の実験的なマルチモーダル API モデルは、同じ価格帯で V4-Flash への画像入力を追加します。 ここでは、何ができるのか、どのようなコストがかかるのか、そして限界はどこにあるのかを説明します。

読了目安 12分OmniaKey
DeepSeek V4 Flash VisionVision APIOCRimage input

DeepSeek-V4-Flash-Vision-Exp は誤解されやすいです。 これはイメージ ジェネレーターではなく、単に新しい名前が付いた通常の V4-Flash モデルでもありません。 これは、V4-Flash のテキスト機能を維持し、画像入力を追加した実験的なマルチモーダル API モデルです。

8 月 21, 2026, の時点での実際的な概要は次のとおりです。

  • Model ID: deepseek-v4-flash-vision-exp
  • テキストの動作: DeepSeek-V4-Flash に準拠しており、エージェント、推論、世界の知識が含まれます。
  • ビジョン: スクリーンショット、チャート、ドキュメント、およびビジュアル エージェント ワークフロー用のテキストと画像の混合入力。
  • 価格: V4-Flash と同じ階層で、ピーク料金とオフピーク料金が含まれます。
  • ステータス: 実験中。 本番環境のデフォルトにする前に、実際の例に対してテストしてください。

このガイドでは、開発者が最もよく抱く検索「DeepSeek V4 Flash Vision とは何ですか?」に答えます。 DeepSeek V4 Flash で画像を表示できますか? DeepSeek ビジョン API の価格はいくらですか? 画像ってどうやって送るんですか? OCR、PDF、Claude Code、または Codex はサポートされていますか? そして、視覚的なタスクに関しては、実際に V4-Pro、GPT、または Claude よりも優れているのでしょうか?

DeepSeek 画像認識 API、画像分析 API、または画像入力エンドポイントを探している人にとって、これは最初に評価するモデルです。

DeepSeek V4 Flash Vision Exp とは何ですか?

DeepSeek-V4-Flash-Vision-Exp は、DeepSeek API プラットフォームで公開されました。 テキストと一緒に画像を受け入れ、回答を返すか、ツールを使用してエージェントのワークフローを継続します。

DeepSeek では、テキスト機能で V4-Flash と一致するモデルとして説明されています。 マルチモーダル エージェント ベンチマークに関して、同社は V4-Flash を大幅に上回り、Opus-4.8. に近づいていると述べています。これは有益な文脈ですが、これは依然として普遍的なランキングではなく、ベンダー ベンチマークの主張です。 視覚的なベンチマーク結果は、そのモデルがあらゆるテキスト、コーディング、またはツール使用のタスクにとって最適な選択であることを証明するものではありません。

公式モデル ページには、1M トークン コンテキスト ウィンドウと最大 384K 出力トークンがリストされています。 思考モードと非思考モード、JSON 出力、ツール呼び出し、Responses API、および Anthropic API をサポートします。 FIM 補完はサポートされていないため、FIM に依存するコーディング ツールを自動的に互換性があるものとして扱うべきではありません。

DeepSeek ハーネス 0.1.1 は、モデルと同日にすぐに使用できるサポート付きでリリースされました。 他のエージェント フレームワークでは、特に画像コンテンツ ブロックとツールの結果に関して独自の互換性チェックが必要です。

DeepSeek V4 Flash ビジョンは何ができますか?

公式の Vision ガイドでは、画像の説明、スクリーンショットのテキスト認識、およびチャート分析について言及しています。 実際の開発者のワークフローでは、最も強力なユースケースはもう少し具体的です。

スクリーンショットのデバッグと UI レビュー

モデルにブラウザーのスクリーンショット、エラー メッセージ、および予想される動作を提供します。 次にどのログやツールを使用するかを決定する前に、表示される状態を検査できます。 これは、人間がすでに問題を診断した後でしか画像を説明できないモデルよりも便利です。

OCR とドキュメントの抽出

モデルは、スクリーンショット、スキャン、レシート、フォーム、ラベルからテキストを読み取り、構造化フィールドを返すことができます。 その出力を決定的な OCR 結果としてではなく、抽出ドラフトとして扱います。 小さなフォント、ぎらつき、ゆがみ、ぼやけ、密集した表については、引き続き検証が必要です。

チャートとダッシュボード

折れ線グラフ、棒グラフ、表のスクリーンショット、または分析ダッシュボードを読み取り、傾向や異常を説明できます。 財務、医療、経営上の決定については、情報源の数値を保存し、結論を確認する人に依頼してください。

ビジュアルエージェント

このモデルは画像とツールを組み合わせることができるため、ブラウザー エージェント、UI テスト、ビジュアル検索、および画面上の内容に基づいて動作する必要があるワークフローに役立ちます。 重要なアップグレードは、単に「この写真には何が写っていますか?」に答えることではありません。 エージェントが動作している間、視覚的なコンテキストをエージェントに提供します。

バッチ画像分類

API では、1 つのリクエストで最大 600 の画像が許可されます。 これは、製品のグループ化、資産の優先順位付け、大量の説明に使用できますが、バッチが小さい方が再試行とレビューが容易です。

DeepSeek V4 Flashにはビジョンがありますか?

通常の deepseek-v4-flash モデルはテキスト モデルです。 画像を送信するには、正確なビジョン モデル ID を使用します。

text
deepseek-v4-flash-vision-exp

クライアントがイメージを V4-Flash または V4-Pro に送信すると、API はモデルがイメージをサポートしていないエラーを返します。 「V4」という言葉だけから視覚サポートを推測しないでください。 モデル ID が重要です。

画像生成モデルですか?

No. DeepSeek-V4-Flash-Vision-Exp は画像理解モデルです。 画像を読み取り、テキストまたはツール呼び出しを生成します。 これは、ポスター、アバター、製品レンダリング、またはその他の新しい画像を生成するための適切なエンドポイントではありません。

DeepSeek V4 Flash Vision Exp API 価格

英語の公式価格ページには、1M トークンごとの価格が米ドルで記載されています。 ビジョン モデルは、V4-Flash と同じレートを使用します。

課金アイテムオフピークピーク
入力、キャッシュヒット$0.007 / 1M トークン$0.014 / 1M トークン
入力、キャッシュミス$0.22 / 1M トークン$0.44 / 1M トークン
出力$0.66 / 1M トークン$1.32 / 1M トークン

ピーク時間は、01:00-04:00 および 06:00-10:00 UTC です。 他の時間帯はすべてオフピークであり、オフピーク料金はピーク料金の半分です。 公式ページは変更される可能性があるため、長期間実行されるアプリケーションの予算を立てる前にもう一度確認してください。

1枚の画像の価格はいくらですか?

画像は、その寸法に基づいて入力トークンに変換されます。 現在の上限は、イメージあたり 384 トークンです。 キャッシュミス入力レートでは、最大サイズのイメージは次のように寄与します。

  • オフピーク: 384 / 1,000,000 x $0.22 = $0.00008448;
  • ピーク: 384 / 1,000,000 x $0.44 = $0.00016896

それは画像入力コンポーネントのみです。 テキスト プロンプト、出力、会話履歴、推論トークン、ツール呼び出しは個別に請求されます。 エージェントのワークフローでは、長い出力と繰り返しの呼び出しにより、通常、画像自体よりもコストが高くなります。

ファイル API は、ファイルのアップロードと再利用に無料で使用できます。 だからといってモデル推論が無料になるわけではありません。画像の読み取りには依然として課金対象の入力トークンが消費されます。

DeepSeek V4 Flash Vision Exp API の使用方法

API は 3 つの画像入力方法をサポートしています。

  1. ローカル画像のBase64データURL。
  2. 公開外部画像 URL。
  3. 大きな画像またはリクエスト間で再利用される画像のファイル API。

以下は、パブリック イメージ URL を使用した最小の OpenAI 互換の Python の例です。

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Read the error message and suggest the next debugging step.",
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/screenshot.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

サンプル URL を一般にアクセス可能な画像に置き換えるか、ローカル ファイルの Base64 データ URL を使用します。 同じ 3 つの入力方法が、Responses API を通じて利用可能です。 Anthropic 互換のメッセージ リクエストでは、異なる画像コンテンツ ブロック形状が使用されるため、OpenAI ブロックを変更せずに Anthropic リクエストにコピーしないでください。

画像の詳細の選択

detail フィールドは、image_url 入力の前処理を制御します。

行動こんなときに使います
low推論前に 512 x 512 にダウンスケールします必要なのはスピードであり、細かい部分は重要ではありません
high元の画像を保持します小さなテキストやグラフの詳細が重要
original元の画像を保持します明示的な完全な詳細動作が必要な場合
auto現在は original と同等デフォルトの動作が必要な場合

同じ画像を繰り返し分析する場合は、ファイル API を通じて一度アップロードし、その file_id を再利用します。 1 回限りの小さなスクリーンショットの場合は、インライン画像またはパブリック URL を使用する方が簡単です。

DeepSeek V4 Flash Vision 画像入力制限

これらの制限は、発表の見出しよりも運用環境において重要です。

限界現在値
サポートされている形式JPEG、PNG、GIF、WebP
リクエストあたりの最大画像数600
リクエストボディ48 MiB
Base64 または外部 URL 経由の 1 つの画像32 MiB
ファイル API 経由の 1 つの画像64 MiB
リクエストあたりの合計画像サイズ64 MiB なし、file_id; 最大 200 MiB (file_id 画像付き)
画像の最大寸法8192 ピクセル/辺
15 以上の画像がある場合4096 ピクセル/辺
外部 URL の長さ8192 文字
外部画像ダウンロード60 秒以内に終了する必要があります

画像は推論前にサイズ変更されます。 小さな画像はアスペクト比を維持しながら拡大されます。 大きな画像は、およそ 800 x 800 画像のピクセル数まで縮小されます。 これが、すべての画像に 384 トークンの上限がある理由であり、小さなテキストを慎重にチェックする必要がある理由でもあります。

標準の Chat Completions および Anthropic メッセージ リクエストの場合、画像はユーザー メッセージに属します。 システムまたはアシスタント メッセージ内の画像は、400 エラーを返します。 Responses API には、ユーザー、開発者、およびツール出力イメージ パーツに関する独自の文書化されたルールがあります。

PDF はサポートされている画像形式の中にリストされていません。 入力が PDF の場合は、まず関連するテキストを抽出するか、ページを JPEG/PNG にレンダリングしてから、代表的なページで結果をテストします。

DeepSeek V4 Flash Vision 対 V4 Flash 対 V4 Pro

タスクより良い出発点なぜ
テキストのみの一括作業と低コストのエージェントV4-Flash画像処理を行わない同じテキスト層
スクリーンショット、写真、グラフ、ビジュアルツールV4-Flash-ビジョン-ExpV4-Flash 価格帯で画像入力を追加
複雑なテキスト推論と最終的なアーキテクチャのレビューV4-プロ難しいテキストのみのタスクのための余裕がさらに広がります

Vision Exp は、より高価な V4-Flash アップグレードではありません。 Flash テキスト層を維持し、視覚的な入力を追加します。 タスクにイメージが含まれていない場合、モデルが新しいからといって切り替える理由はありません。

また、V4-Pro の代替品を保証するものではありません。 公式の「Opus-4.8 に近い」という声明は、マルチモーダル エージェントのベンチマークに関するものです。 実際のアプリケーションの場合は、同じイメージ セット、プロンプト、ツール、遅延目標、および許容基準でモデルを比較します。 その後、DeepSeek は新しい Flash ルートをリリースしました。 DeepSeek V4.1 Flash レビュー では、現在のモデル ID、ネイティブ ビジョン契約、価格、個別の V4 Pro ステータスについて説明しています。

DeepSeek V4 Flash Vision は無料ですか? ローカルで実行できますか?

API は有料です。 入力、イメージ トークン、出力、およびツール呼び出しが課金されます。 ファイル API のアップロード機能は無料ですが、推論は無料ではありません。

発売のお知らせでは、DeepSeek API プラットフォームでの利用可能性を確認しています。 この実験的なビジョン モデルが消費者の Web またはアプリのインターフェイスで利用可能であるとは述べられていないため、V4-Pro の「エキスパート モード」セレクターにそれが含まれているとは想定しないでください。

ローカル展開を想定しないでください。 DeepSeek は V4 テキスト モデルのオープン ウェイト情報を公開していますが、Vision Exp のローンチ ノートでは、この実験的な API モデルのオープン ウェイトについては発表していません。 公式モデル カードとライセンスが利用可能になるまで、「API を通じて利用可能」と「ローカル推論用にダウンロード可能」は別の主張として扱う必要があります。

生産チェックリスト

実際の交通にモデルを使用する前に、少なくとも 20 ~ 50 の代表的な画像をテストし、記録します。

  • 実際に重要なフィールドの OCR の精度。
  • チャートと表の解釈の正確さ。
  • 画像が提供された後のツール呼び出しの成功率。
  • レイテンシとタイムアウトの動作。
  • 入力、出力、推論トークンの使用法。
  • 実験モデルが失敗した場合のフォールバック動作。

元の画像とモデルの応答を一緒に保存して、レビュー担当者がモデルが実際に何を見たのかを確認できるようにします。 機密文書の場合は、ホストされたモデルに送信する前に、保存期間を最小限に抑え、アクセスを制限します。

よくある質問

DeepSeek V4 Flash Vision は画像を生成できますか?

いいえ、画像を理解してテキストまたはツール呼び出しを返します。 新しいビジュアルアセットには画像生成モデルを使用します。

DeepSeek V4 Flash Vision は OCR をサポートしていますか?

スクリーンショットやドキュメント内のテキストを読み取ることができますが、決定論的な OCR エンジンではありません。 2 番目の方法を使用して、小さいテキスト、回転したテキスト、ぼやけたテキスト、または危険性の高いテキストを検証します。

DeepSeek V4 Flash ビジョン API の価格はいくらですか?

現在の公式レートは、キャッシュされていない入力トークン 1M あたり $0.22、オフピークの出力トークン 1M あたり $0.66 です。 ピーク レートは $0.44 および $1.32. です。キャッシュ ヒット入力の方が安価です。 イメージ トークンには同じ V4-Flash 価格が使用されます。

通常の DeepSeek V4 Flashはイメージをサポートしていますか?

いいえ。正確な deepseek-v4-flash-vision-exp モデル ID を使用してください。 その他の DeepSeek モデルは画像入力を拒否します。

Claude Codeまたは Codex で使用できますか?

このモデルは、Responses API、Anthropic API、およびツール呼び出しをサポートしているため、エージェントのワークフローに適合できます。 特定のクライアントが確実に動作するかどうかは、そのクライアントの画像コンテンツとツール結果の実装によって決まります。 プロトコルの互換性が優れたユーザー エクスペリエンスに等しいと仮定するのではなく、実際のクライアントをテストしてください。

DeepSeek V4 Flash Vision はオープンソースですか?

現在の Vision Exp の発売発表では、無差別級リリースではなく、API リリースが確認されています。 別の V4 テキスト モデルの発表からローカル展開のサポートを推測しないでください。

DeepSeek が画像をアップロードしない場合、またはテキストが欠落している場合はどうなりますか?

ファイルが JPEG、PNG、GIF、または WebP であること、サイズ制限内に収まっていること、および外部 URL にアクセスできることを確認してください。 小さなテキストの場合は、detail=high または original を試してください。 大きな画像や再利用するファイルには、ファイル API を使用してください。 2 番目の方法で重要なフィールドを検証します。

結論

DeepSeek-V4-Flash-Vision-Exp は、エージェントがブラウザ画面、チャート、レシート、スキャンしたフォーム、製品画像などを見る必要がある場合に最も興味深いものです。 その実際的な提案はシンプルです。V4-Flash のテキスト動作、画像入力、および V4-Flash の価格設定です。

これは、V4-Pro、GPT、Claude、プロフェッショナル OCR、またはイメージ生成モデルの汎用的な代替品ではありません。 固定イメージのテスト セットから開始し、精度とワークフローの合計コストを測定し、モデルに Exp ラベルが付いている間はフォールバックを維持します。

私自身のスタックでは、確立された Claude、GPT、および Gemini の使用状況と請求を OmniaKey を通じて表示できるようにし、この DeepSeek モデルをビジュアル スペシャリストとして個別にテストしています。 これにより、発売の発表をテストされていない本番環境への移行に変えるのではなく、比較が測定可能になります。

公式情報源