← Back to Blog
By GenCybers.inc

DeepSeek V4 Flash Vision Exp 上线:多模态 API 正式开放

DeepSeek V4 Flash Vision Exp 正式上线 API。本文回顾此前无原生视觉 API 与 App 灰度识图阶段,并详解模型能力、基准、传图方式和限制。

DeepSeek V4 Flash Vision Exp 上线:多模态 API 正式开放

2026 年 8 月 21 日,DeepSeek 在官方更新日志中宣布 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台。开发者现在可以通过 model="deepseek-v4-flash-vision-exp" 调用模型,并在标准对话请求中直接传入图片。

这不是在文本模型前额外接一个“看图转文字”服务,而是 DeepSeek V4 Flash 系列首次以 API 形式提供的原生视觉理解能力。它仍是一个实验性质模型,但对需要读取截图、图表、网页、文档或多图任务的 Agent 来说,这次发布意味着能力边界从“只能处理文字”扩展到了“能够理解图像输入”。

这次上线改变了什么

此前,deepseek-v4-flash 的公开 API 定位是文本模型:可以用于推理、代码、工具调用和 Agent 工作流,但不能直接接收图片。例如 DeepSeek 在 GitHub Copilot 集成文档中曾明确说明,V4 是纯文本模型;要处理图片,需要先借助其他视觉模型把图像转换成文字,再交给 DeepSeek 处理。

现在,开发者可在同一轮请求中提交文字和图片。例如,让模型阅读产品截图、提取界面中的文字、解释图表,或让 Agent 根据网页截图继续操作。根据官方文档,只有 deepseek-v4-flash-vision-exp 接受图片;向其他模型传图会返回 400 错误。

从“没有视觉 API”到 App 灰度体验

DeepSeek 的 V4 系列早期公开能力以文本与 Agent 为主。2026 年 4 月的 V4 预览版对外开放了 App、网页和 API 使用,但公开模型主要是 deepseek-v4-prodeepseek-v4-flash,并没有面向开发者的图片输入模型标识、传图格式或文件 API 说明。

在本次 API 上线之前,外界已经观察到 DeepSeek App 与网页端出现过小范围的“识图”或视觉理解体验。那一阶段更接近产品侧灰度测试:用户可以在对话中上传图片并获得文字回复,但开发者无法像今天这样在 API 中显式指定视觉模型、选择图片细节级别,或通过 Files API 复用图像文件。

需要区分两个事实:App/Web 端曾出现视觉能力的测试或灰度体验,以及 2026 年 8 月 21 日正式开放 API 的模型。公开材料没有把此前产品端测试所用模型权重与 DeepSeek-V4-Flash-Vision-Exp 作一一确认,因此不应直接断言两者完全相同。可以确定的是,这次公告把此前偏产品体验的视觉能力,变成了有模型名、有输入规范、有文件接口和限制说明的开发者能力。

新模型的定位:V4 Flash 的视觉实验版

DeepSeek-V4-Flash-Vision-Exp 中的 Exp 代表实验性质。官方给出的定位并不是用视觉换取文本能力,而是尽量保持 V4 Flash 的文本表现,同时补上视觉理解。

官方表示,在 Agent、推理和世界知识等纯文本能力上,该模型与 DeepSeek-V4-Flash 正式版持平;在需要视觉理解的 Agent 基准中,则相较普通 V4 Flash 有显著提升。官方还称其多模态 Agent 能力“接近 Opus-4.8”。这是一项基于指定测试集与测试设置的比较,应理解为这些基准上的参考结果,而不是所有任务、所有提示词下的普遍排名。

官方benchmark

基准测试V4 Flash Vision ExpV4 Flash-0731Opus-4.8
Terminal Bench 2.183.982.785.0
NL2Repo57.754.269.7
DeepSWE59.354.458.0
DSBench-Hard63.659.671.7
AutomationBench(Public)25.725.127.2
ApexBench(Pass@1)36.526.239.4
Agents' Last Exam27.325.225.7
Chartography64.365.0
ZeroBench(Pass@5)35.034.0

官方同时说明:在公开代码 Agent 文本基准中,DeepSeek 系列模型使用 DeepSeek Harness 的极简模式,并采用 max 档位、top_p=0.95temperature=1.0;ApexBench 和 Agents' Last Exam 中的纯文本 V4 Flash 会忽略多模态元素。阅读上表时,应把这些评测设置一并纳入判断。

可以传什么图片,怎样传

该模型支持 JPEG、PNG、GIF 与 WebP。DeepSeek 按文件实际内容而非文件扩展名或声明的 MIME 类型识别格式。

官方提供三种图片输入方式:

  1. Base64 data URL:适合本地图片或一次性的小文件,直接把编码后的图片放进请求。
  2. 外部图片 URL:提供可公开访问的 http(s) 链接,由服务端下载图片。
  3. Files API 的 file_id:先上传图片,再在后续请求中引用,适合复用文件或较大的图片。

在 OpenAI 兼容的 Chat Completions 接口中,消息的 content 需要写成块数组:一个文本块加一个 image_urlfile 块。下面是基于官方格式的最小示例:

from openai import OpenAI

client = OpenAI(
    api_key="<DeepSeek API Key>",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "请提取截图中的主要信息,并说明下一步操作。"},
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/screenshot.png",
                        "detail": "low",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

detail 可设为 lowhighoriginalauto。其中 low 会在推理前把图像缩放至 512×512,适合不依赖细节的快速任务;当前 autooriginal 等价。需要读取小字、表格或复杂图表时,应优先使用 original,并在业务中对关键结论进行复核。

图片 token、文件大小与接口限制

视觉输入不是免费附加项,而是会折算为 token,并与文本 token 一起计费。官方说明,图片会先被自动缩放:小于约 384×384 的图像会等比放大;更大的图像会等比缩小到总像素约为 800×800。单张图片最多消耗 384 个 token,因此极大的图片不一定带来更多视觉 token,但也不意味着其中的细节一定会被完整保留。

使用时尤其要注意下面的限制:

限制项官方数值
请求体大小48 MiB
Base64 / 外部 URL 单图大小32 MiB
Files API file_id 单图大小64 MiB
单请求最大图片数600 张
单请求图片总大小不含 file_id 时最多 64 MiB;含 file_id 时最高 200 MiB
最大图像边长8192 像素;单请求 15 张及以上时为 4096 像素
外部 URL 最大长度8192 字符

外部 URL 还需要在 60 秒内下载完成。图片会在多个请求中重复使用,或内联内容会让请求超过 48 MiB 时,Files API 通常是更合适的选择。

在 Chat Completions 中,图片只能放在 user 消息中。Responses API 的输入形式略有不同,使用 input_image 内容块;它还允许在 userdeveloper 消息以及工具调用输出中承载图片。DeepSeek 也提供 Anthropic 兼容的 /messages 端点,方便已有 Anthropic SDK 工作流接入。

对 Agent 和内容工作流意味着什么

官方公告展示的方向并不只是一问一答的图片描述,而是多模态 Agent:根据旅游网页信息生成演示文稿、结合设计参考进行二次创作,以及根据视觉素材参与前端 Mini Demo 的制作。这些示例说明模型更适合作为“看见界面和素材后继续行动”的 Agent 组件,而不是孤立的 OCR 工具。

对于内容团队和博客后台,较直接的落地场景包括:

  • 从封面图或产品截图生成可编辑的图片 alt 文本与内容摘要;
  • 读取图表和仪表盘截图,先生成结构化要点,再由编辑核对数字;
  • 审阅文章中的截图是否与正文描述一致;
  • 在带浏览器或文件工具的 Agent 中,依据页面截图辅助定位操作步骤。

不过,视觉理解结果仍应视为模型输出,而不是事实来源。特别是小字号 OCR、图表精确数值、法律/医疗/财务文件、人物与品牌识别,以及版权归属等任务,必须保留人工核验或原始数据校验。官方文档描述的是图片理解输入与文本接口,不应据此推断它已经提供图像生成、视频理解或无误识别能力。

结语

DeepSeek V4 Flash Vision Exp 的关键意义,不只是“V4 Flash 终于可以看图”,而是 DeepSeek 把视觉能力从此前产品端可见的测试体验,推进为开发者可以正式接入的多模态 API:有明确模型名、OpenAI/Anthropic 兼容请求格式、Files API,以及可量化的文件与 token 限制。

由于它仍带有 Exp 标签,最合适的策略是先在截图理解、图片摘要、多图 Agent 等可验证场景中试用,记录准确率、延迟和 token 成本,再决定是否承担更关键的生产流程。对于原本已经使用 V4 Flash 做文本推理和 Agent 编排的团队,这会是一条相对自然的多模态升级路径。

相关资源

来源声明

本文来自 merchmindai.net。分享或转载本文时,请注明出处,并附上原文链接。

原文链接:https://merchmindai.net/blog/zh/post/deepseek-v4-flash-vision-exp-launch