刚刚,DeepSeek 在 API 平台上线实验模型deepseek-v4-flash-vision-exp,开始提供图像理解服务。
根据 DeepSeek 官方文档,用户可以通过设置 来访问 V4-Flash-Vision-Exp 模型的 API。
在 API 服务中,图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。
多模态 API 支持 Chat Completions、Messages、Responses 三种格式调用,可以方便接入各类 Agent 工具中使用,支持图文混合输入,支持 base64 内联、外部 URL、Files API 三种图片传入方式。
这是 DeepSeek V4 系列首次通过官方 API 明确开放视觉输入,也补上了其在多模态开发场景中的一块能力拼图。
在此之前,DeepSeek V4 系列主要以文本推理、代码生成和 Agent 能力见长。
4 月发布的 V4-Flash 采用混合专家架构,总参数量 2840 亿、每个 Token 激活约 130 亿参数,并将 100 万 Token 上下文作为默认配置。
7 月底上线的 V4-Flash-0731 又通过新一轮后训练,重点强化工具调用和长周期 Agent 任务。
但相比之下,Vision-Exp 模型多数指标高于 V4-Flash-0731。
在七项测试中的六项发生变化,其中五项提升、一项小幅下降:
- Terminal Bench 2.1:82.7→83.9
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜