DeepSeek V4 Flash Vision Exp 上线:多模态 API 正式开放
DeepSeek V4 Flash Vision Exp 正式上线 API。本文回顾此前无原生视觉 API 与 App 灰度识图阶段,并详解模型能力、基准、传图方式和限制。

2026 年 8 月 21 日,DeepSeek 在官方更新日志中宣布 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台。开发者现在可以通过 model="deepseek-v4-flash-vision-exp" 调用模型,并在标准对话请求中直接传入图片。
这不是在文本模型前额外接一个“看图转文字”服务,而是 DeepSeek V4 Flash 系列首次以 API 形式提供的原生视觉理解能力。它仍是一个实验性质模型,但对需要读取截图、图表、网页、文档或多图任务的 Agent 来说,这次发布意味着能力边界从“只能处理文字”扩展到了“能够理解图像输入”。
这次上线改变了什么
此前,deepseek-v4-flash 的公开 API 定位是文本模型:可以用于推理、代码、工具调用和 Agent 工作流,但不能直接接收图片。例如 DeepSeek 在 GitHub Copilot 集成文档中曾明确说明,V4 是纯文本模型;要处理图片,需要先借助其他视觉模型把图像转换成文字,再交给 DeepSeek 处理。
现在,开发者可在同一轮请求中提交文字和图片。例如,让模型阅读产品截图、提取界面中的文字、解释图表,或让 Agent 根据网页截图继续操作。根据官方文档,只有 deepseek-v4-flash-vision-exp 接受图片;向其他模型传图会返回 400 错误。
从“没有视觉 API”到 App 灰度体验
DeepSeek 的 V4 系列早期公开能力以文本与 Agent 为主。2026 年 4 月的 V4 预览版对外开放了 App、网页和 API 使用,但公开模型主要是 deepseek-v4-pro 与 deepseek-v4-flash,并没有面向开发者的图片输入模型标识、传图格式或文件 API 说明。
在本次 API 上线之前,外界已经观察到 DeepSeek App 与网页端出现过小范围的“识图”或视觉理解体验。那一阶段更接近产品侧灰度测试:用户可以在对话中上传图片并获得文字回复,但开发者无法像今天这样在 API 中显式指定视觉模型、选择图片细节级别,或通过 Files API 复用图像文件。
需要区分两个事实:App/Web 端曾出现视觉能力的测试或灰度体验,以及 2026 年 8 月 21 日正式开放 API 的模型。公开材料没有把此前产品端测试所用模型权重与 DeepSeek-V4-Flash-Vision-Exp 作一一确认,因此不应直接断言两者完全相同。可以确定的是,这次公告把此前偏产品体验的视觉能力,变成了有模型名、有输入规范、有文件接口和限制说明的开发者能力。
新模型的定位:V4 Flash 的视觉实验版
DeepSeek-V4-Flash-Vision-Exp 中的 Exp 代表实验性质。官方给出的定位并不是用视觉换取文本能力,而是尽量保持 V4 Flash 的文本表现,同时补上视觉理解。
官方表示,在 Agent、推理和世界知识等纯文本能力上,该模型与 DeepSeek-V4-Flash 正式版持平;在需要视觉理解的 Agent 基准中,则相较普通 V4 Flash 有显著提升。官方还称其多模态 Agent 能力“接近 Opus-4.8”。这是一项基于指定测试集与测试设置的比较,应理解为这些基准上的参考结果,而不是所有任务、所有提示词下的普遍排名。

| 基准测试 | V4 Flash Vision Exp | V4 Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench(Public) | 25.7 | 25.1 | 27.2 |
| ApexBench(Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench(Pass@5) | 35.0 | — | 34.0 |
官方同时说明:在公开代码 Agent 文本基准中,DeepSeek 系列模型使用 DeepSeek Harness 的极简模式,并采用 max 档位、top_p=0.95、temperature=1.0;ApexBench 和 Agents' Last Exam 中的纯文本 V4 Flash 会忽略多模态元素。阅读上表时,应把这些评测设置一并纳入判断。
可以传什么图片,怎样传
该模型支持 JPEG、PNG、GIF 与 WebP。DeepSeek 按文件实际内容而非文件扩展名或声明的 MIME 类型识别格式。
官方提供三种图片输入方式:
- Base64 data URL:适合本地图片或一次性的小文件,直接把编码后的图片放进请求。
- 外部图片 URL:提供可公开访问的
http(s)链接,由服务端下载图片。 - Files API 的
file_id:先上传图片,再在后续请求中引用,适合复用文件或较大的图片。
在 OpenAI 兼容的 Chat Completions 接口中,消息的 content 需要写成块数组:一个文本块加一个 image_url 或 file 块。下面是基于官方格式的最小示例:
from openai import OpenAI
client = OpenAI(
api_key="<DeepSeek API Key>",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "请提取截图中的主要信息,并说明下一步操作。"},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/screenshot.png",
"detail": "low",
},
},
],
}
],
)
print(response.choices[0].message.content)
detail 可设为 low、high、original 或 auto。其中 low 会在推理前把图像缩放至 512×512,适合不依赖细节的快速任务;当前 auto 与 original 等价。需要读取小字、表格或复杂图表时,应优先使用 original,并在业务中对关键结论进行复核。
图片 token、文件大小与接口限制
视觉输入不是免费附加项,而是会折算为 token,并与文本 token 一起计费。官方说明,图片会先被自动缩放:小于约 384×384 的图像会等比放大;更大的图像会等比缩小到总像素约为 800×800。单张图片最多消耗 384 个 token,因此极大的图片不一定带来更多视觉 token,但也不意味着其中的细节一定会被完整保留。
使用时尤其要注意下面的限制:
| 限制项 | 官方数值 |
|---|---|
| 请求体大小 | 48 MiB |
| Base64 / 外部 URL 单图大小 | 32 MiB |
Files API file_id 单图大小 | 64 MiB |
| 单请求最大图片数 | 600 张 |
| 单请求图片总大小 | 不含 file_id 时最多 64 MiB;含 file_id 时最高 200 MiB |
| 最大图像边长 | 8192 像素;单请求 15 张及以上时为 4096 像素 |
| 外部 URL 最大长度 | 8192 字符 |
外部 URL 还需要在 60 秒内下载完成。图片会在多个请求中重复使用,或内联内容会让请求超过 48 MiB 时,Files API 通常是更合适的选择。
在 Chat Completions 中,图片只能放在 user 消息中。Responses API 的输入形式略有不同,使用 input_image 内容块;它还允许在 user、developer 消息以及工具调用输出中承载图片。DeepSeek 也提供 Anthropic 兼容的 /messages 端点,方便已有 Anthropic SDK 工作流接入。
对 Agent 和内容工作流意味着什么
官方公告展示的方向并不只是一问一答的图片描述,而是多模态 Agent:根据旅游网页信息生成演示文稿、结合设计参考进行二次创作,以及根据视觉素材参与前端 Mini Demo 的制作。这些示例说明模型更适合作为“看见界面和素材后继续行动”的 Agent 组件,而不是孤立的 OCR 工具。
对于内容团队和博客后台,较直接的落地场景包括:
- 从封面图或产品截图生成可编辑的图片 alt 文本与内容摘要;
- 读取图表和仪表盘截图,先生成结构化要点,再由编辑核对数字;
- 审阅文章中的截图是否与正文描述一致;
- 在带浏览器或文件工具的 Agent 中,依据页面截图辅助定位操作步骤。
不过,视觉理解结果仍应视为模型输出,而不是事实来源。特别是小字号 OCR、图表精确数值、法律/医疗/财务文件、人物与品牌识别,以及版权归属等任务,必须保留人工核验或原始数据校验。官方文档描述的是图片理解输入与文本接口,不应据此推断它已经提供图像生成、视频理解或无误识别能力。
结语
DeepSeek V4 Flash Vision Exp 的关键意义,不只是“V4 Flash 终于可以看图”,而是 DeepSeek 把视觉能力从此前产品端可见的测试体验,推进为开发者可以正式接入的多模态 API:有明确模型名、OpenAI/Anthropic 兼容请求格式、Files API,以及可量化的文件与 token 限制。
由于它仍带有 Exp 标签,最合适的策略是先在截图理解、图片摘要、多图 Agent 等可验证场景中试用,记录准确率、延迟和 token 成本,再决定是否承担更关键的生产流程。对于原本已经使用 V4 Flash 做文本推理和 Agent 编排的团队,这会是一条相对自然的多模态升级路径。
相关资源
来源声明
本文来自 merchmindai.net。分享或转载本文时,请注明出处,并附上原文链接。
原文链接:https://merchmindai.net/blog/zh/post/deepseek-v4-flash-vision-exp-launch



