DeepSeek V4-Flash-Vision-Exp est disponible : le service API multimodal est en ligne
Ce qui vient de se passer
La plateforme API de DeepSeek ajoute aujourd'hui un nouveau modèle : V4-Flash-Vision-Exp. Il est expérimental et ajoute la compréhension d'images à la ligne V4-Flash. L'accès est simple — il suffit de définir model='deepseek-v4-flash-vision-exp' dans l'appel API.
Ce n'est pas un nouveau modèle de base. C'est V4-Flash avec de la vision par-dessus. La vraie question : que conserve-t-il, et que change-t-il ?
Les chiffres qui comptent
Les performances textuelles — tâches Agent, raisonnement, connaissances — sont au niveau de DeepSeek-V4-Flash. Sur cette dimension, rien n'a été sacrifié.
Sur les benchmarks Agent qui exigent de la vision, V4-Flash-Vision-Exp bondit devant V4-Flash. L'écart est assez grand pour que DeepSeek le place près d'Opus-4.8 en capacité Agent multimodale.
Concrètement : le modèle lit des images sans abandonner ce qui faisait de V4-Flash un outil rapide et peu coûteux pour le texte.
| Capacité | V4-Flash | V4-Flash-Vision-Exp |
|---|---|---|
| Texte (Agent, raisonnement, connaissances) | Référent | Équivalent à V4-Flash |
| Agent multimodal | Non disponible | Amélioration majeure, proche d'Opus-4.8 |
| Prix API | 0,14 $ / M tokens | Identique à V4-Flash |
| Coût par image | — | Jusqu'à 384 tokens par image |
Pourquoi la vision change les flux Agent
Un modèle texte-only suit des instructions. Un modèle avec vision peut aussi regarder ce que ces instructions produisent. Cette différence ouvre des scénarios qui n'étaient pas pratiques auparavant.
Exemple 1 : génération de présentation personnalisée dans un framework Agent
Le prompt demande une présentation sur un road-trip tibétain d'un mois, pour des clients fortunés : ton sauvage et explorateur, photos réalistes, et trois plans tarifaires réels. Le modèle prend le brief, étudie l'itinéraire, structure le contenu et génère les diapositives.
L'essentiel : d'un prompt descriptif à un livrable métier terminé, le tout dans la boucle Agent.
Exemple 2 : refonte de site web
Le même modèle reprend le site de DeepSeek Harness et le réinvente. Le brief de design : mer profonde bleu et noir, interface vitreuse, pixels atomiques ASCII. Après plusieurs tours d'itération, le résultat est un portail de développeur futuriste.
C'est dans ce genre de tâche que la vision fait la différence : le modèle évalue chaque révision par rapport au brief visuel, pas juste au texte du prompt.
Exemple 3 : démo animée front-end
Un prompt décrivant « de mignons monstres en pâte 3D qui rejoignent une soirée de dance rétro » devient un mini-démo interactif fonctionnel. Le modèle écrit le code front-end et affine le résultat visuel jusqu'à ce qu'il corresponde au brief.
Accès à l'API
Le modèle est disponible via l'API standard de DeepSeek. Définissez :
model = 'deepseek-v4-flash-vision-exp'Les images sont converties en tokens et facturées au tarif V4-Flash. Chaque image coûte jusqu'à 384 tokens.
Trois formats d'API sont supportés : Chat Completions, Messages, Responses. L'entrée d'images accepte trois méthodes : base64 en ligne, URL externe, et le nouveau Files API.
Files API aussi lancé
En parallèle du modèle de vision, DeepSeek a ouvert un Files API. Il est gratuit. Le flux : télécharger une image une fois, obtenir un file_id, puis référencer cet ID dans autant de requêtes que nécessaire. La même image n'a pas besoin d'être re-téléchargée.
Pour les équipes qui appellent l'API à grande échelle — pipelines Agent, jobs par lots, intégrations en production — cela réduit la taille des requêtes et supprime les surcoûts de téléversement répété.
Ce que cela signifie
V4-Flash avait déjà l'un des meilleurs rapports qualité-prix du marché. V4-Flash-Vision-Exp conserve ce prix et ajoute la vision par-dessus. Cette combinaison en fait une option sérieuse pour les frameworks Agent qui ont besoin de comprendre des images sans saut de coût.
Le label expérimental mérite attention. DeepSeek teste encore ce modèle avant une version stable. Les premiers utilisateurs devraient surveiller les évolutions.
En résumé
- Capacité texte : inchangée par rapport à V4-Flash
- Vision : nouvelle, assez forte pour approcher Opus-4.8 dans les benchmarks Agent
- Prix : identique à V4-Flash, images jusqu'à 384 tokens chacune
- Accès : API standard + nouveau Files API pour la réutilisation d'images
Pour les équipes dont les flux Agent impliquent une sortie visuelle ou une entrée d'images, V4-Flash-Vision-Exp mérite un test.