← 返回新闻列表
InfoQ AI 🗓️ 2026-08-21

DeepSeek 发布多模态模型,“小鲸鱼”长出了眼睛,这意味着什么?

⚡ 一句话看懂:DeepSeek 发布多模态模型,“小鲸鱼”长出了眼睛,这意味着什么?。来源:InfoQ AI。

刚刚,DeepSeek 在 API 平台上线实验模型deepseek-v4-flash-vision-exp,开始提供图像理解服务。

根据 DeepSeek 官方文档,用户可以通过设置 来访问 V4-Flash-Vision-Exp 模型的 API。

在 API 服务中,图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。

多模态 API 支持 Chat Completions、Messages、Responses 三种格式调用,可以方便接入各类 Agent 工具中使用,支持图文混合输入,支持 base64 内联、外部 URL、Files API 三种图片传入方式。

这是 DeepSeek V4 系列首次通过官方 API 明确开放视觉输入,也补上了其在多模态开发场景中的一块能力拼图。

在此之前,DeepSeek V4 系列主要以文本推理、代码生成和 Agent 能力见长。

4 月发布的 V4-Flash 采用混合专家架构,总参数量 2840 亿、每个 Token 激活约 130 亿参数,并将 100 万 Token 上下文作为默认配置。

7 月底上线的 V4-Flash-0731 又通过新一轮后训练,重点强化工具调用和长周期 Agent 任务。

但相比之下,Vision-Exp 模型多数指标高于 V4-Flash-0731。

在七项测试中的六项发生变化,其中五项提升、一项小幅下降:

  • Terminal Bench 2.1:82.7→83.9

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接