DeepSeek V4-Flash-Vision-Exp 上线:多模态 API 服务正式开放
发生了什么
DeepSeek API 平台今天上线了一个新模型:V4-Flash-Vision-Exp。它是实验性质的,为 V4-Flash 系列增加了图片理解能力。调用方式很直接 —— 在 API 请求里设置 model='deepseek-v4-flash-vision-exp' 即可。
这不是一个新底座模型。它是 V4-Flash 加上视觉能力。真正的问题是:加视觉后,它保留了什么,又改变了什么。
关键数据
文本能力 —— Agent 任务、推理、世界知识 —— 与 DeepSeek-V4-Flash 正式版持平。在这个维度上,没有牺牲。
在需要视觉理解的 Agent 基准测试上,V4-Flash-Vision-Exp 相比 V4-Flash 有大幅提升。差距大到 DeepSeek 把它定位为接近 Opus-4.8 的多模态 Agent 水平。
实际含义:这个模型能读图,同时没有丢掉 V4-Flash 在文本上的速度和成本优势。
| 能力维度 | V4-Flash | V4-Flash-Vision-Exp |
|---|---|---|
| 文本(Agent、推理、知识) | 基线 | 与 V4-Flash 持平 |
| 多模态 Agent | 不支持 | 大幅提升,接近 Opus-4.8 |
| API 价格 | $0.14 / 百万 tokens | 与 V4-Flash 一致 |
| 图片 token 成本 | — | 每张图最多 384 tokens |

视觉能力为什么改变 Agent 工作流
纯文本模型能执行指令。能看图的模型还能判断指令执行出来的结果长什么样。这个差别打开了以前不实际的新场景。
示例 1:Agent 框架内生成定制 PPT
提示词要求做一份西藏自驾游 PPT,面向高净值客户,走野性、探索感路线,用真实摄影风格配图,最后给三种真实定价方案。模型接到需求后,规划路线、组织内容、生成幻灯片,产出一份完整的演示文稿。
关键点:从一句描述性提示词到一份可用的商业交付物,都在 Agent 循环内完成。

示例 2:网站二次创作
同一个模型拿 DeepSeek Harness 官网做二次创作。设计 brief:黑蓝深海、玻璃 UI、ASCII 原子像素。经过多轮迭代,最终产出一个未来主义风格的开发者网站。
这类任务里视觉能力很关键:模型不是在改文案,而是在对照视觉 brief 逐轮调整设计产出。
示例 3:前端动画 Demo
一个描述「一群可爱的 3D 黏土小怪物加入跃动的复古舞池派对」的提示词,被模型写成了一个可交互的 Mini Demo。模型写了前端代码,并持续调整视觉效果直到符合 brief。

API 接入方式
该模型通过 DeepSeek 标准 API 提供。设置:
model = 'deepseek-v4-flash-vision-exp'图片会被转为 tokens 计费,按 V4-Flash 价格。每张图片最多消耗 384 tokens。
支持三种 API 格式:Chat Completions、Messages、Responses。图片输入支持三种方式 —— base64 内联、外部 URL、以及新的 Files API。
Files API 同步上线
配合视觉模型,DeepSeek 同时开放了 Files API。这个 API 不收费。流程是:上传一张图片,拿到 file_id,之后在所有请求里直接用这个 ID 引用,不需要重复上传。
对大规模调用 API 的团队 —— Agent 流水线、批处理、生产集成 —— 这能减少请求体积,去掉反复上传的开销。
这意味着什么
V4-Flash 本来就已经是市场上性价比最高的模型之一。V4-Flash-Vision-Exp 保持这个价格,同时加上了视觉能力。这个组合让它成为 Agent 框架里值得认真考虑的选项 —— 需要看图,但不想付出额外成本。
实验性质的标签值得关注。DeepSeek 还在测试这个模型,稳定版什么时候来、能力会不会调整,都还没定。早期使用者需要留意后续变化。
总结
- 文本能力:与 V4-Flash 不变
- 视觉能力:新增,Agent 基准接近 Opus-4.8
- 价格:与 V4-Flash 一致,图片最多 384 tokens/张
- 接入:标准 API + 新的 Files API(图片复用)
如果你的 Agent 工作流涉及视觉输出或图片输入,V4-Flash-Vision-Exp 值得跑一轮试试。