街坊秀 街坊秀

当前位置: 首页 » 街坊资讯 »

刚刚,DeepSeek首个多模态模型发布!!

(来源:Datawhale Datawhale)

 Datawhale干货 

最新发布:DeepSeek-V4-Flash-Vision-Exp

就在刚刚,DeepSeek 第一个多模态模型来了!!

最新官方 API 文档显示,一款名为 deepseek-v4-flash-vision-exp 的实验性模型已经上线。

和此前只能处理文本的 V4 系列不同,新模型正式加入图片理解能力。现在,它不仅能读文字、写代码、调用工具,还能直接查看图片、识别截图中的文字、分析图表,并围绕视觉信息完成后续任务。

一、DeepSeek,终于补上了“眼睛”

从命名来看,deepseek-v4-flash-vision-exp 基于 V4 Flash,后缀中的 vision-exp 表明它目前仍是一款实验性视觉模型。

新模型支持 JPEG、PNG、GIF 和 WebP 四种图片格式。开发者可以直接提交 Base64 编码图片、提供公开访问的图片 URL,或者通过 Files API 上传并引用图片。

它同时兼容 OpenAI Chat Completions、Responses API 与 Anthropic API 格式。

换句话说,现有 Agent 和开发工具不必重新设计整套接口。修改模型名称和图片内容块,就能接入 DeepSeek 的视觉能力。

二、一次最多看 600 张图

这次上线的不只是简单的“看图问答”。

官方文档显示,新模型单次请求最多可以输入 600 张图片,图片最长边最高支持 8192 像素。

  • Base64 或外部 URL:单张图片最大 32 MiB

  • Files API:单张图片最大 64 MiB

  • 包含 file_id 图片时:单次请求图片总量最高 200 MiB

模型还提供不同的图片细节等级。low 模式会将图片缩放至 512×512,速度更快、Token 消耗更低;original 模式保留原图;auto 当前等同于原图模式。

每张图片进入模型前都会按尺寸换算成 Token,单张消耗最高为 384 Token。因此,即使输入超高分辨率图片,成本也不会无限增长。

这让它更适合批量截图分析、长文档检查、数据图表理解,以及需要持续观察界面的视觉 Agent。

三、多模态 Agent,开始逼近 Opus

据官方发布,新模型在多项 Agent Benchmark 上的成绩如下:

相比原来的 DeepSeek V4 Flash,新模型在依赖视觉理解的 Agent 任务上提升明显,多模态 Agent 能力已接近 Claude Opus 4.8。该比较尚未出现在 DeepSeek 当前的官方模型文档中,仍需等待更完整的技术说明与第三方测试。

真正值得关注的不是某一个单项分数,而是 DeepSeek 正在把视觉理解与原有的推理、编程、工具调用能力连接起来。

过去的 DeepSeek Agent 主要依靠文本、网页源码和结构化数据理解环境。现在,它可以直接读取软件界面、错误截图、数据图表和图文混排文档,再决定下一步调用什么工具。

四、价格与 V4 Flash 相同

还是梁圣,价格依旧超级低价!

deepseek-v4-flash-vision-exp 的调用价格与 V4 Flash 保持一致,并采用高峰、空闲两档计费。高峰时段为北京时间 9:00—12:00、14:00—18:00,其余时间为空闲时段。

图片会按尺寸转换为 Token,与文本 Token 一并计费。新模型的并发限制为 2500,与 V4 Flash 相同。

如果后续正式版继续维持这一价格,DeepSeek 很可能会再次压低多模态 Agent 的使用门槛!

写在最后:现在已经可以调用

大家目前已经可以通过 DeepSeek API 访问新模型了!

原有 API 地址保持不变:

https://api.deepseek.com

只需要把模型名称修改为:

deepseek-v4-flash-vision-exp

如果使用 DeepSeek Harness,则需升级至 0.1.1-rc.1 或更高版本。

需要注意,模型名称中的 exp 说明它仍处于实验阶段,能力表现、接口限制和模型版本后续都可能调整。目前也只有这一视觉模型能够接受图片;将图片传给普通的 V4 Flash 或 V4 Pro,会直接返回错误。

此外,视觉版暂不支持 FIM 补全,图片在 Chat Completions 与 Anthropic Messages 接口中只能出现在 user 消息里。

从 V4 Flash 到 V4 Pro,再到今天的 V4 Flash Vision,DeepSeek V4 的产品结构正在变得更加完整:

  • Flash:速度和低成本

  • Pro:复杂推理与高规格 Agent

  • Vision:图像、截图与界面理解

DeepSeek 的多模态拼图,终于开始补上了!

未经允许不得转载: 街坊秀 » 刚刚,DeepSeek首个多模态模型发布!!