首页 > 教程攻略 > ai资讯 >DeepSeekV4视觉模型上线,多模态Agent能力已接近Opus-4.8

DeepSeekV4视觉模型上线,多模态Agent能力已接近Opus-4.8

来源:互联网 时间:2026-08-23 13:04:03

【快讯】据第一财经报道,8 月 21 日下午,DeepSeek 官方 API 文档的模型详情页面上线新模型 DeepSeek-V4-Flash-Vision-Exp。

\

据悉,这是 V4 系列当中首款原生支持图片输入的视觉模型。该模型具备 100 万上下文窗口,最大输出长度 384K,支持 JSON 输出、工具调用、Responses API、Anthropic API 兼容以及对话前缀续写,图片将依据尺寸折算为 Token,和文本 Token 合并计费。

在纯文本能力方面,DeepSeek-V4-Flash-Vision-Exp与DeepSeek-V4-Flash正式版持平;在需要视觉理解的Agent Benchmark上,DeepSeek-V4-Flash-Vision-Exp相比DeepSeek-V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8

\

在定价方面,DeepSeek-V4-Flash-Vision-Exp当前API资费与普通V4-Flash相同,按Token计费且不额外加价,一张图片最多折算384个Token1。具体收费标准如下:

  • 输入(缓存命中):空闲时段0.05元/百万Token,高峰时段0.10元/百万Token
  • 输入(缓存未命中):空闲时段1.5元/百万Token,高峰时段3.0元/百万Token
  • 输出:空闲时段4.5元/百万Token,高峰时段9.0元/百万Token
其中,高峰时段指每日北京时间9:00-12:00、14:00-18:00,闲时价格为高峰时段的一半1

距离 DeepSeek 开源 Agent Harness 框架刚过去一周,视觉能力便完成接入。以往相互独立的模型、图片、文件、工具、Agent 执行链路得以打通,DeepSeek 补齐了 Agent 体系重要的感知输入环节。