DeepSeek V4-Flash-Vision-Exp上线:多模态API正式开放
8月21日消息,深度求索郑重宣布,一款全新的多模态视觉理解模型——DeepSeek-V4-Flash-Vision-Exp,已正式在DeepSeek API平台上线啦!需注意的是,这是一款实验性质的模型哦。它在文本理解、推理以及Agent能力方面,与官方的DeepSeek-V4-Flash不相上下,同时还进一步增添了视觉理解能力。用户只需通过API,就能直接调用它。此次更新具有重要意义,它意味着DeepSeek在多模态能力方面,又朝着Agent应用场景迈进了一步,为PPT制作、网页开发以及前端创意等各类任务,提供了全新的模型能力支撑。

DeepSeek
从官方公布的信息来看,DeepSeek-V4-Flash-Vision-Exp的核心特点在于兼顾文本和多模态能力。在Agent、推理、世界知识等纯文本任务中,该模型的表现与DeepSeek-V4-Flash正式版基本持平,并没有因为增加视觉能力而明显牺牲文本处理能力。而在需要理解图像内容的Agent Benchmark中,新模型相比DeepSeek-V4-Flash则实现了明显提升,多模态Agent能力已经接近Opus-4.8。
在实际应用方面,深度求索展示了多个使用案例。其中一个场景是借助Agent框架制作商业定制西藏自驾游PPT。用户可以直接提出包括路线、行程周期、目标客户以及视觉风格在内的复杂要求,模型随后结合多模态能力完成内容和视觉呈现。另一个案例则是对DeepSeek Harness官网进行二次创作,通过黑蓝深海、玻璃UI以及ASCII原子像素等视觉元素,在多轮交互后生成具有未来主义风格的开发者网站。此外,模型还可以用于制作动态前端Mini Demo,例如按照“3D黏土小怪物加入复古舞池派对”的创意生成相应的动态视觉效果。
从这些案例不难发现,此次升级的重点,并非仅仅是赋予模型“看图”的能力,而是期望将视觉理解更深层次地融入到Agent的工作流程之中。对于那些需要同时处理文字、图片、网页以及代码的任务来说,模型一旦能够理解视觉信息,就可以更深入地参与到内容生成、页面设计以及交互开发等环节,从而覆盖更多以往主要依赖文本模型但效果有限的应用场景。
API服务方面,开发者可以通过设置model='deepseek-v4-flash-vision-exp'调用这一实验模型。图片在API服务中会转换为Token并按照Token计费,单张图片最多占用384个Token,整体计费价格与DeepSeek-V4-Flash保持一致。接口目前支持Chat Completions、Messages和Responses三种调用格式,并支持图文混合输入。图片既可以通过Base64内联方式传入,也可以使用外部URL或Files API进行调用,因此能够适配不同的Agent开发框架和应用场景。
与此同时,深度求索还宣布Files API正式开放,而且该API本身不收取费用。开发者可以提前将图片上传至平台,之后在API请求中直接通过file_id引用对应文件,无需在每一次请求中重复上传同一张图片。对于需要反复调用相同素材的Agent应用而言,这种方式能够减少重复传输带来的带宽开销,也有助于简化开发流程。
-
- 我好喜欢你是什么梗?
- 角色扮演 |
-
- 新学期开学季祝福语简短励志(15篇)
- 角色扮演 |
-
- 白露时节问候短信(15篇)
- 角色扮演 |
-
- 寒露祝福语温馨的话(30篇)
- 角色扮演 |
-
- 每天一条早上问候短信
- 角色扮演 |