(来源:Datawhale Datawhale)
Datawhale干货
最新发布:DeepSeek-V4-Flash-Vision-Exp
就在刚刚,DeepSeek 第一个多模态模型来了!!
最新官方 API 文档显示,一款名为 deepseek-v4-flash-vision-exp 的实验性模型已经上线。
和此前只能处理文本的 V4 系列不同,新模型正式加入图片理解能力。现在,它不仅能读文字、写代码、调用工具,还能直接查看图片、识别截图中的文字、分析图表,并围绕视觉信息完成后续任务。
一、DeepSeek,终于补上了“眼睛”
从命名来看,deepseek-v4-flash-vision-exp 基于 V4 Flash,后缀中的 vision-exp 表明它目前仍是一款实验性视觉模型。
新模型支持 JPEG、PNG、GIF 和 WebP 四种图片格式。开发者可以直接提交 Base64 编码图片、提供公开访问的图片 URL,或者通过 Files API 上传并引用图片。
它同时兼容 OpenAI Chat Completions、Responses API 与 Anthropic API 格式。
换句话说,现有 Agent 和开发工具不必重新设计整套接口。修改模型名称和图片内容块,就能接入 DeepSeek 的视觉能力。
二、一次最多看 600 张图
这次上线的不只是简单的“看图问答”。
官方文档显示,新模型单次请求最多可以输入 600 张图片,图片最长边最高支持 8192 像素。
Base64 或外部 URL:单张图片最大 32 MiB
Files API:单张图片最大 64 MiB
包含 file_id 图片时:单次请求图片总量最高 200 MiB
模型还提供不同的图片细节等级。low 模式会将图片缩放至 512×512,速度更快、Token 消耗更低;original 模式保留原图;auto 当前等同于原图模式。
每张图片进入模型前都会按尺寸换算成 Token,单张消耗最高为 384 Token。因此,即使输入超高分辨率图片,成本也不会无限增长。
这让它更适合批量截图分析、长文档检查、数据图表理解,以及需要持续观察界面的视觉 Agent。
三、多模态 Agent,开始逼近 Opus
据官方发布,新模型在多项 Agent Benchmark 上的成绩如下:
相比原来的 DeepSeek V4 Flash,新模型在依赖视觉理解的 Agent 任务上提升明显,多模态 Agent 能力已接近 Claude Opus 4.8。该比较尚未出现在 DeepSeek 当前的官方模型文档中,仍需等待更完整的技术说明与第三方测试。
真正值得关注的不是某一个单项分数,而是 DeepSeek 正在把视觉理解与原有的推理、编程、工具调用能力连接起来。
过去的 DeepSeek Agent 主要依靠文本、网页源码和结构化数据理解环境。现在,它可以直接读取软件界面、错误截图、数据图表和图文混排文档,再决定下一步调用什么工具。
四、价格与 V4 Flash 相同
还是梁圣,价格依旧超级低价!
deepseek-v4-flash-vision-exp 的调用价格与 V4 Flash 保持一致,并采用高峰、空闲两档计费。高峰时段为北京时间 9:00—12:00、14:00—18:00,其余时间为空闲时段。
图片会按尺寸转换为 Token,与文本 Token 一并计费。新模型的并发限制为 2500,与 V4 Flash 相同。
如果后续正式版继续维持这一价格,DeepSeek 很可能会再次压低多模态 Agent 的使用门槛!
写在最后:现在已经可以调用
大家目前已经可以通过 DeepSeek API 访问新模型了!
原有 API 地址保持不变:
https://api.deepseek.com只需要把模型名称修改为:
deepseek-v4-flash-vision-exp如果使用 DeepSeek Harness,则需升级至 0.1.1-rc.1 或更高版本。
需要注意,模型名称中的 exp 说明它仍处于实验阶段,能力表现、接口限制和模型版本后续都可能调整。目前也只有这一视觉模型能够接受图片;将图片传给普通的 V4 Flash 或 V4 Pro,会直接返回错误。
此外,视觉版暂不支持 FIM 补全,图片在 Chat Completions 与 Anthropic Messages 接口中只能出现在 user 消息里。
从 V4 Flash 到 V4 Pro,再到今天的 V4 Flash Vision,DeepSeek V4 的产品结构正在变得更加完整:
Flash:速度和低成本
Pro:复杂推理与高规格 Agent
Vision:图像、截图与界面理解
DeepSeek 的多模态拼图,终于开始补上了!