Le modèle Jev est désormais intégré et disponible · Bienvenue
Blogue
Guider

DeepSeek V4 Flash Vision Exp

Le modèle multimodal expérimental API de DeepSeek ajoute une entrée d'image à V4-Flash au même niveau de prix. Voici ce que cela peut faire, ce que cela coûte et quelles sont les limites.

12 minutes de lectureOmniaKey
DeepSeek V4 Flash VisionVision APIOCRimage input

DeepSeek-V4-Flash-Vision-Exp est facile à mal comprendre. Ce n'est pas un générateur d'images, et ce n'est pas simplement le modèle V4-Flash classique avec un nouveau nom. Il s'agit d'un modèle expérimental multimodal API qui conserve les capacités de texte de V4-Flash et ajoute la saisie d'images.

Depuis août 21, 2026,, le résumé pratique est :

  • Model ID : deepseek-v4-flash-vision-exp.
  • Comportement du texte : aligné sur DeepSeek-V4-Flash, y compris les agents, le raisonnement et la connaissance du monde.
  • Vision : saisie mixte de texte et d'images pour les captures d'écran, les graphiques, les documents et les flux de travail des agents visuels.
  • Tarification : le même niveau que V4-Flash, avec des tarifs heures pleines et heures creuses.
  • Statut : expérimental. Testez-le sur des exemples réels avant d’en faire un défaut de production.

Ce guide répond aux recherches que les développeurs sont les plus susceptibles d'effectuer : Qu'est-ce que DeepSeek V4 Flash Vision ? Le DeepSeek V4 Flash peut-il visualiser les images ? Combien coûte le DeepSeek Vision API ? Comment envoyer une image ? Prend-il en charge OCR, les PDF, le code Claude ou Codex ? Et est-il réellement meilleur que V4-Pro, GPT ou Claude pour les tâches visuelles ?

Pour tous ceux qui recherchent une reconnaissance d'image DeepSeek API, une analyse d'image API ou un point final d'entrée d'image, c'est le modèle à évaluer en premier.

Qu'est-ce que DeepSeek V4 Flash Vision Exp ?

DeepSeek-V4-Flash-Vision-Exp est désormais disponible sur la plateforme DeepSeek API. Il accepte les images à côté du texte, puis renvoie une réponse ou poursuit le flux de travail d'un agent avec des outils.

DeepSeek décrit le modèle comme correspondant aux capacités de texte de V4-Flash. En ce qui concerne les benchmarks d'agents multimodaux, la société affirme avoir fait un bond majeur par rapport à V4-Flash et se rapproche de Opus-4.8.. C'est un contexte utile, mais il s'agit toujours d'une affirmation de référence de fournisseur plutôt que d'un classement universel. Un résultat de référence visuelle ne prouve pas que le modèle est le meilleur choix pour chaque tâche de texte, de codage ou d’utilisation d’outils.

La page de modèle officielle répertorie une fenêtre contextuelle de jeton 1M et jusqu'à des jetons de sortie 384K. Il prend en charge les modes de réflexion et de non-réflexion, la sortie JSON, les appels d'outils, le Responses API et le Anthropic API. La complétion FIM n'est pas prise en charge, donc un outil de codage qui dépend de FIM ne doit pas être traité comme automatiquement compatible.

Le harnais DeepSeek 0.1.1 a été lancé avec un support prêt à l'emploi le même jour que le modèle. D'autres frameworks d'agents nécessitent toujours leur propre vérification de compatibilité, en particulier autour des blocs de contenu d'image et des résultats des outils.

Que peut faire le DeepSeek V4 Flash Vision ?

Le guide officiel Vision nomme la description de l'image, la reconnaissance du texte de capture d'écran et l'analyse des graphiques. Dans un véritable workflow de développeur, les cas d'utilisation les plus forts sont un peu plus spécifiques.

Débogage de capture d'écran et révision de l'interface utilisateur

Donnez au modèle une capture d'écran du navigateur, un message d'erreur et le comportement attendu. Il peut inspecter l’état visible avant de décider quels journaux ou outils utiliser ensuite. C'est plus utile qu'un modèle qui ne peut décrire une image qu'après qu'un humain a déjà diagnostiqué le problème.

OCR et extraction de documents

Le modèle peut lire le texte des captures d'écran, des numérisations, des reçus, des formulaires et des étiquettes, puis renvoyer des champs structurés. Traitez cette sortie comme une ébauche d'extraction, et non comme un résultat déterministe OCR. Les petites polices, les reflets, l'inclinaison, le flou et les tableaux denses doivent encore être vérifiés.

Graphiques et tableaux de bord

Il peut lire un graphique linéaire, un graphique à barres, une capture d'écran d'un tableau ou un tableau de bord analytique et expliquer les tendances ou les anomalies. Pour les décisions financières, médicales ou opérationnelles, conservez les numéros sources et demandez à une personne de vérifier la conclusion.

Agents visuels

Le modèle peut combiner une image avec des outils, ce qui le rend utile pour les agents de navigateur, les tests d'interface utilisateur, la recherche visuelle et les flux de travail qui doivent agir sur ce qui est à l'écran. La mise à jour importante ne consiste pas seulement à répondre « qu’est-ce qu’il y a dans cette image ? » ; cela donne à un agent un contexte visuel pendant qu'il fonctionne.

Classification des images par lots

Le API permet jusqu'à des images 600 en une seule requête. Cela peut fonctionner pour le regroupement de produits, le tri des actifs et les descriptions groupées, bien que les lots plus petits soient plus faciles à réessayer et à examiner.

Le flash DeepSeek V4 a-t-il une vision ?

Le modèle deepseek-v4-flash ordinaire est le modèle texte. Pour envoyer une image, utilisez l'ID exact du modèle de vision :

text
deepseek-v4-flash-vision-exp

Si un client envoie une image à V4-Flash ou V4-Pro, le API renvoie une erreur de modèle ne prend pas en charge l'image. Ne déduisez pas le soutien visuel du seul mot « V4 » ; l'ID du modèle est important.

Est-ce un modèle de génération d'images ?

Le numéro DeepSeek-V4-Flash-Vision-Exp est un modèle de compréhension d'image. Il lit les images et produit des appels de texte ou d'outils. Ce n'est pas le bon point de terminaison pour générer une affiche, un avatar, un rendu de produit ou toute autre nouvelle image.

Prix ​​DeepSeek V4 Flash Vision Exp API

La page de tarification officielle en anglais répertorie les prix par jetons 1M en dollars américains. Le modèle de vision utilise les mêmes tarifs que le V4-Flash :

Élément de facturationHors pointePic
Entrée, accès au cacheJetons $0.007 / 1MJetons $0.014 / 1M
Entrée, échec du cacheJetons $0.22 / 1MJetons $0.44 / 1M
SortieJetons $0.66 / 1MJetons $1.32 / 1M

Les heures de pointe sont 01:00-04:00 et 06:00-10:00 UTC. Toutes les autres heures sont hors pointe et les tarifs hors pointe correspondent à la moitié des tarifs de pointe. La page officielle peut changer, alors vérifiez-la à nouveau avant de budgétiser une application de longue durée.

Combien coûte une image ?

Les images sont converties en jetons d'entrée en fonction de leurs dimensions. La limite supérieure actuelle est de jetons 384 par image. Au taux d'entrée d'échec du cache, une image de taille maximale contribue environ :

  • Heures creuses : 384 / 1,000,000 x $0.22 = $0.00008448 ;
  • Pic : 384 / 1,000,000 x $0.44 = $0.00016896.

Ce n'est que le composant d'entrée d'image. L'invite de texte, la sortie, l'historique des conversations, les jetons de raisonnement et les appels d'outils sont facturés séparément. Dans un flux de travail d'agent, les sorties longues et les appels répétés coûtent généralement plus cher que l'image elle-même.

Les fichiers API sont gratuits à utiliser pour télécharger et réutiliser un fichier. Cela ne rend pas l'inférence du modèle gratuite : la lecture de l'image consomme toujours des jetons d'entrée facturables.

Comment utiliser le Flash Vision Exp DeepSeek V4 API

Le API prend en charge trois méthodes de saisie d'image :

  1. URL de données Base64 pour les images locales ;
  2. URL d’images externes publiques ;
  3. Les fichiers API pour les images volumineuses ou les images réutilisées à travers les requêtes.

Voici le plus petit exemple de Python compatible OpenAI utilisant une URL d'image publique :

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Read the error message and suggest the next debugging step.",
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/screenshot.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

Remplacez l'exemple d'URL par une image accessible au public ou utilisez une URL de données Base64 pour un fichier local. Les trois mêmes méthodes de saisie sont disponibles via le Responses API. Les requêtes de messages compatibles avec Anthropic utilisent une forme de bloc de contenu d'image différente. Ne copiez donc pas un bloc OpenAI dans une requête Anthropic sans modification.

Choisir les détails de l'image

Le champ detail contrôle le prétraitement des entrées image_url :

ValeurComportementUtilisez-le quand
lowRéduction à 512 x 512 avant l'inférenceVous avez besoin de vitesse et la finesse des détails n'est pas importante
highConserve l'image originaleLes petits détails du texte ou du graphique sont importants
originalConserve l'image originaleVous voulez un comportement explicite et détaillé
autoActuellement équivalent à originalVous voulez le comportement par défaut

Pour une analyse répétée de la même image, téléchargez-la une fois via les fichiers API et réutilisez son file_id. Pour une petite capture d'écran unique, une image en ligne ou une URL publique est plus simple.

Limites d'entrée d'image de Vision Flash DeepSeek V4

Ces limites comptent plus en production que le titre de lancement :

LimiteValeur actuelle
Formats pris en chargeJPEG, PNG, GIF, WebP
Nombre maximum d'images par demande600
Corps de la demande48 MiB
Une image via Base64 ou URL externe32 MiB
Une image via les fichiers API64 MiB
Taille totale de l'image par demande64 MiB sans file_id ; jusqu'à 200 MiB avec des images file_id
Dimension maximale de l'image8192 px par côté
Avec 15 ou plus d'images4096 px par côté
Longueur de l'URL externeCaractères 8192
Téléchargement d'images externesDoit terminer dans les 60 secondes

Les images sont redimensionnées avant l'inférence. Les petites images sont agrandies tout en préservant leurs proportions ; les images plus grandes sont réduites à peu près au nombre de pixels d'une image 800 x 800. C'est pourquoi chaque image a un plafond de jetons 384, et aussi pourquoi les petits textes doivent être soigneusement vérifiés.

Pour les demandes de messages Chat Completions et Anthropic standard, les images appartiennent aux messages utilisateur. Les images dans les messages du système ou de l'assistant renvoient une erreur 400. Le Responses API possède ses propres règles documentées pour les parties d'image de sortie d'utilisateur, de développeur et d'outil.

Le PDF n'est pas répertorié parmi les formats d'image pris en charge. Si l'entrée est un PDF, extrayez le texte pertinent ou restituez d'abord les pages au format JPEG/PNG, puis testez le résultat sur des pages représentatives.

DeepSeek V4 Flash Vision contre V4 Flash contre V4 Pro

TâcheMeilleur point de départPourquoi
Travail en masse de texte uniquement et agents à faible coûtV4-FlashMême niveau de texte sans traitement d'image
Captures d'écran, photos, graphiques et outils visuelsV4-Flash-Vision-ExpAjoute une entrée d'image au niveau de prix V4-Flash
Raisonnement de texte complexe et revue finale de l'architectureV4-ProPlus de marge pour les tâches difficiles contenant uniquement du texte

Vision Exp n'est pas une mise à niveau V4-Flash plus coûteuse. Il conserve le niveau de texte Flash et ajoute une entrée visuelle. Si une tâche ne contient aucune image, il n’y a aucune raison de changer simplement parce que le modèle est plus récent.

Il ne s'agit pas non plus d'un remplacement garanti du V4-Pro. La déclaration officielle « proche de l'Opus-4.8 » concerne les benchmarks d'agents multimodaux. Pour une application réelle, comparez les modèles sur le même ensemble d'images, les mêmes invites, les mêmes outils, la même cible de latence et les mêmes critères d'acceptation. DeepSeek a depuis publié une nouvelle route Flash. La DeepSeek V4.1 Flash review couvre son ID de modèle actuel, son contrat de vision natif, ses prix et son statut V4 Pro distinct.

Le DeepSeek V4 Flash Vision est-il gratuit ? Pouvez-vous l’exécuter localement ?

Le API est payant. Les entrées, les jetons d'image, les sorties et les appels d'outils sont facturés. La fonctionnalité de téléchargement de fichiers API est gratuite, mais l'inférence ne l'est pas.

L'annonce de lancement confirme la disponibilité sur la plateforme DeepSeek API. Il n'est pas indiqué que ce modèle de vision expérimental est disponible dans l'interface Web ou dans l'application grand public, il ne faut donc pas présumer que le sélecteur « Mode Expert » de V4-Pro l'inclut.

Ne présumez pas d'un déploiement local. DeepSeek a publié des informations sur les poids ouverts pour les modèles de texte V4, mais la note de lancement de Vision Exp n'annonce pas les poids ouverts pour ce modèle expérimental API. Jusqu'à ce qu'une carte de modèle et une licence officielles soient disponibles, « disponible via le API » et « téléchargeable pour inférence locale » doivent être traités comme des allégations différentes.

Liste de contrôle de production

Avant d'utiliser le modèle pour le trafic réel, testez au moins les images représentatives 20-50 et enregistrez :

  • Précision OCR sur les champs qui comptent réellement ;
  • précision de l'interprétation des graphiques et des tableaux ;
  • taux de réussite des appels d'outils après la fourniture d'une image ;
  • comportement de latence et de délai d'attente ;
  • utilisation des jetons d'entrée, de sortie et de raisonnement ;
  • comportement de repli lorsque le modèle expérimental échoue.

Conservez l'image originale et la réponse du modèle ensemble afin qu'un réviseur puisse voir ce que le modèle a réellement vu. Pour les documents sensibles, minimisez la rétention et restreignez l’accès avant de les envoyer à un modèle hébergé.

FAQ

Le DeepSeek V4 Flash Vision peut-il générer des images ?

Non. Il comprend les images et renvoie du texte ou des appels d’outils. Utilisez un modèle de génération d'images pour les nouveaux éléments visuels.

DeepSeek V4 Flash Vision prend-il en charge OCR ?

Il peut lire du texte dans des captures d'écran et des documents, mais ce n'est pas un moteur déterministe OCR. Validez un texte petit, pivoté, flou ou à enjeux élevés avec une deuxième méthode.

Quel est le prix du DeepSeek V4 Flash Vision API ?

Le tarif officiel actuel est de $0.22 par jeton d'entrée non mis en cache 1M et de $0.66 par jeton de sortie 1M hors pointe. Les taux de pointe sont $0.44 et $1.32.. L'entrée d'accès au cache est moins chère. Les jetons d'image utilisent la même tarification V4-Flash.

Le Flash DeepSeek V4 standard prend-il en charge les images ?

Non. Utilisez l’ID de modèle deepseek-v4-flash-vision-exp exact. Les autres modèles DeepSeek rejettent la saisie d'images.

Puis-je l'utiliser avec le code Claude ou Codex ?

Le modèle prend en charge Responses API, Anthropic API et les appels d'outils, afin de s'adapter à un flux de travail d'agent. La fiabilité du fonctionnement d'un client particulier dépend de la mise en œuvre du contenu de son image et du résultat de son outil. Testez le client réel plutôt que de supposer que la compatibilité des protocoles équivaut à une bonne expérience utilisateur.

Le DeepSeek V4 Flash Vision est-il open source ?

L'annonce actuelle du lancement de Vision Exp confirme une version API, et non une version à poids ouvert. Ne déduisez pas la prise en charge du déploiement local à partir des annonces distinctes du modèle de texte V4.

Que se passe-t-il si DeepSeek ne télécharge pas d'image ou manque le texte ?

Vérifiez que le fichier est au format JPEG, PNG, GIF ou WebP, qu'il respecte les limites de taille et qu'une URL externe est accessible. Pour un petit texte, essayez detail=high ou original ; utilisez les Fichiers API pour une grande image ou un fichier que vous réutiliserez. Vérifiez les champs importants avec une deuxième méthode.

Conclusion

DeepSeek-V4-Flash-Vision-Exp est particulièrement intéressant lorsqu'un agent a besoin de voir : un écran de navigateur, un graphique, un reçu, un formulaire numérisé ou une image de produit. Son argumentaire pratique est simple : comportement du texte V4-Flash, saisie d'images et tarification V4-Flash.

Il ne s'agit pas d'un remplacement universel pour les modèles V4-Pro, GPT, Claude, professionnels OCR ou de génération d'images. Commencez avec un ensemble de test d'image fixe, mesurez la précision et le coût total du flux de travail, et conservez une solution de secours pendant que le modèle porte toujours l'étiquette Exp.

Dans ma propre pile, je garde l'utilisation et la facturation établies de Claude, GPT et Gemini visibles via OmniaKey, tout en testant ce modèle DeepSeek séparément en tant que spécialiste visuel. Cela rend la comparaison mesurable au lieu de transformer une annonce de lancement en une migration de production non testée.

Sources officielles