DeepSeek V4-Flash-Vision-Exp est disponible : le service API multimodal est en ligne
Actualités5 min de lecture

DeepSeek V4-Flash-Vision-Exp est disponible : le service API multimodal est en ligne

Cataito Team2026-08-21

Ce qui vient de se passer

La plateforme API de DeepSeek ajoute aujourd'hui un nouveau modèle : V4-Flash-Vision-Exp. Il est expérimental et ajoute la compréhension d'images à la ligne V4-Flash. L'accès est simple — il suffit de définir model='deepseek-v4-flash-vision-exp' dans l'appel API.

Ce n'est pas un nouveau modèle de base. C'est V4-Flash avec de la vision par-dessus. La vraie question : que conserve-t-il, et que change-t-il ?

Les chiffres qui comptent

Les performances textuelles — tâches Agent, raisonnement, connaissances — sont au niveau de DeepSeek-V4-Flash. Sur cette dimension, rien n'a été sacrifié.

Sur les benchmarks Agent qui exigent de la vision, V4-Flash-Vision-Exp bondit devant V4-Flash. L'écart est assez grand pour que DeepSeek le place près d'Opus-4.8 en capacité Agent multimodale.

Concrètement : le modèle lit des images sans abandonner ce qui faisait de V4-Flash un outil rapide et peu coûteux pour le texte.

CapacitéV4-FlashV4-Flash-Vision-Exp
Texte (Agent, raisonnement, connaissances)RéférentÉquivalent à V4-Flash
Agent multimodalNon disponibleAmélioration majeure, proche d'Opus-4.8
Prix API0,14 $ / M tokensIdentique à V4-Flash
Coût par imageJusqu'à 384 tokens par image

Pourquoi la vision change les flux Agent

Un modèle texte-only suit des instructions. Un modèle avec vision peut aussi regarder ce que ces instructions produisent. Cette différence ouvre des scénarios qui n'étaient pas pratiques auparavant.

Exemple 1 : génération de présentation personnalisée dans un framework Agent

Le prompt demande une présentation sur un road-trip tibétain d'un mois, pour des clients fortunés : ton sauvage et explorateur, photos réalistes, et trois plans tarifaires réels. Le modèle prend le brief, étudie l'itinéraire, structure le contenu et génère les diapositives.

L'essentiel : d'un prompt descriptif à un livrable métier terminé, le tout dans la boucle Agent.

Exemple 2 : refonte de site web

Le même modèle reprend le site de DeepSeek Harness et le réinvente. Le brief de design : mer profonde bleu et noir, interface vitreuse, pixels atomiques ASCII. Après plusieurs tours d'itération, le résultat est un portail de développeur futuriste.

C'est dans ce genre de tâche que la vision fait la différence : le modèle évalue chaque révision par rapport au brief visuel, pas juste au texte du prompt.

Exemple 3 : démo animée front-end

Un prompt décrivant « de mignons monstres en pâte 3D qui rejoignent une soirée de dance rétro » devient un mini-démo interactif fonctionnel. Le modèle écrit le code front-end et affine le résultat visuel jusqu'à ce qu'il corresponde au brief.

Accès à l'API

Le modèle est disponible via l'API standard de DeepSeek. Définissez :

python
model = 'deepseek-v4-flash-vision-exp'

Les images sont converties en tokens et facturées au tarif V4-Flash. Chaque image coûte jusqu'à 384 tokens.

Trois formats d'API sont supportés : Chat Completions, Messages, Responses. L'entrée d'images accepte trois méthodes : base64 en ligne, URL externe, et le nouveau Files API.

Files API aussi lancé

En parallèle du modèle de vision, DeepSeek a ouvert un Files API. Il est gratuit. Le flux : télécharger une image une fois, obtenir un file_id, puis référencer cet ID dans autant de requêtes que nécessaire. La même image n'a pas besoin d'être re-téléchargée.

Pour les équipes qui appellent l'API à grande échelle — pipelines Agent, jobs par lots, intégrations en production — cela réduit la taille des requêtes et supprime les surcoûts de téléversement répété.

Ce que cela signifie

V4-Flash avait déjà l'un des meilleurs rapports qualité-prix du marché. V4-Flash-Vision-Exp conserve ce prix et ajoute la vision par-dessus. Cette combinaison en fait une option sérieuse pour les frameworks Agent qui ont besoin de comprendre des images sans saut de coût.

Le label expérimental mérite attention. DeepSeek teste encore ce modèle avant une version stable. Les premiers utilisateurs devraient surveiller les évolutions.

En résumé

  • Capacité texte : inchangée par rapport à V4-Flash
  • Vision : nouvelle, assez forte pour approcher Opus-4.8 dans les benchmarks Agent
  • Prix : identique à V4-Flash, images jusqu'à 384 tokens chacune
  • Accès : API standard + nouveau Files API pour la réutilisation d'images

Pour les équipes dont les flux Agent impliquent une sortie visuelle ou une entrée d'images, V4-Flash-Vision-Exp mérite un test.

DeepSeekV4-FlashVision ModelMultimodalAPIAgentOpus-4.8