DeepSeek V4-Flash-Vision-Exp se lanza: el servicio de API multimodal ya está disponible
Noticias5 min de lectura

DeepSeek V4-Flash-Vision-Exp se lanza: el servicio de API multimodal ya está disponible

Cataito Team2026-08-21

Qué acaba de pasar

La plataforma de API de DeepSeek añadió hoy un nuevo modelo: V4-Flash-Vision-Exp. Es experimental y aporta comprensión de imágenes a la línea V4-Flash. El acceso es directo: establece model='deepseek-v4-flash-vision-exp' en tu llamada a la API.

No es un nuevo modelo base. Es V4-Flash con visión añadida por encima. La pregunta importante es qué se mantiene y qué cambia.

Los números que importan

El rendimiento de texto — tareas de Agent, razonamiento, conocimiento del mundo — está al nivel de DeepSeek-V4-Flash. En esta dimensión no se sacrificó nada.

En los benchmarks de Agent que requieren visión, V4-Flash-Vision-Exp salta por delante de V4-Flash. La brecha es lo bastante grande como para que DeepSeek lo coloque cerca de Opus-4.8 en capacidad de agente multimodal.

En la práctica: el modelo lee imágenes sin renunciar a lo que hacía a V4-Flash rápido y barato para texto.

CapacidadV4-FlashV4-Flash-Vision-Exp
Texto (Agent, razonamiento, conocimiento)Línea baseIgual a V4-Flash
Agente multimodalNo disponibleMejora importante, cerca de Opus-4.8
Precio de API$0,14 / M tokensIgual al de V4-Flash
Coste por imagenHasta 384 tokens por imagen

Por qué la visión cambia los flujos de Agent

Un modelo solo de texto sigue instrucciones. Un modelo con visión también puede mirar lo que esas instrucciones producen. Esa diferencia abre escenarios que antes no eran prácticos.

Ejemplo 1: Generación de presentación personalizada dentro de un framework de Agent

El prompt pide una presentación sobre un viaje en coche por el Tíbet de un mes, orientada a clientes de alto patrimonio: tono salvaje y explorador, fotografía real, y tres planes de precio reales. El modelo toma el brief, investiga la ruta, estructura el contenido y genera las diapositivas.

Lo clave: de un prompt descriptivo a un entregable de negocio terminado, todo dentro del bucle del Agent.

Ejemplo 2: Rediseño de sitio web

El mismo modelo toma la página de DeepSeek Harness y la reelabora. El brief de diseño: mar profundo azul y negro, interfaz de cristal, píxeles atómicos en ASCII. Tras varias rondas de ajuste, el resultado es un portal de desarrollador futurista.

Aquí la visión importa de verdad: el modelo evalúa cada revisión frente al brief visual, no solo frente al texto del prompt.

Ejemplo 3: Demo animado de front-end

Un prompt que describe «monstruos de arcilla 3D adorables en una fiesta retro de baile» se convierte en un mini-demo interactivo funcional. El modelo escribe el código de front-end y ajusta el resultado visual hasta que coincide con el brief.

Acceso a la API

El modelo está disponible a través de la API estándar de DeepSeek. Establece:

python
model = 'deepseek-v4-flash-vision-exp'

Las imágenes se convierten en tokens y se facturan al precio de V4-Flash. Cada imagen cuesta hasta 384 tokens.

Se soportan tres formatos de API: Chat Completions, Messages y Responses. La entrada de imágenes acepta tres métodos: base64 en línea, URL externa y la nueva Files API.

Files API también se lanza

Junto con el modelo de visión, DeepSeek abrió una Files API. Es gratuita. El flujo: subir una imagen una vez, obtener un file_id y referenciar ese ID en todas las llamadas que quieras. La misma imagen no necesita subirse de nuevo.

Para equipos que llaman a la API a gran escala — pipelines de Agent, trabajos por lotes, integraciones en producción — esto reduce el tamaño de la petición y elimina el gasto de subir la imagen una y otra vez.

Qué significa esto

V4-Flash ya tenía uno de los mejores ratios de precio por rendimiento del mercado. V4-Flash-Vision-Exp mantiene ese precio y le suma visión encima. La combinación lo convierte en una opción seria para frameworks de Agent que necesitan entender imágenes sin un salto de coste.

El etiqueta de experimental merece atención. DeepSeek está probando el modelo antes de un lanzamiento estable. Los primeros usuarios deberían vigilar los cambios.

En resumen

  • Capacidad de texto: sin cambios respecto a V4-Flash
  • Visión: nueva, lo bastante fuerte como para acercarse a Opus-4.8 en benchmarks de Agent
  • Precio: igual al de V4-Flash; imágenes hasta 384 tokens cada una
  • Acceso: API estándar, más la nueva Files API para reutilizar imágenes

Para equipos con flujos de Agent que impliquen salida visual o entrada de imágenes, V4-Flash-Vision-Exp merece una prueba.

DeepSeekV4-FlashVision ModelMultimodalAPIAgentOpus-4.8