DeepSeek小模型长了眼睛,Agent基准干翻顶级闭源模型
DeepSeek轻量多模态模型V4-Flash-Vision-Exp,在Agent基准测试中击败顶级闭源模型,视觉与文本性能双优且成本可控。核心内容:1. 多维度基准测试成绩优异,Agents' Last Exam、ZeroBench等超闭源模型2. 视觉能力叠加后文本性能未降,DeepSWE、Toolathlon等任务成绩提升3. 轻量架构+成本控制,Agent工作流能力增强,多场景实用价值显著

8月21日,DeepSeek正式发布V4-Flash-Vision-Exp——V4-Flash的多模态视觉实验版。名字里带个"Exp",但跑出来的数据一点不像实验品。

先来看最惊人的数字。在专门用于测试Agent综合能力的基准Agents' Last Exam中,V4-Flash-Vision-Exp获得了27.3分,而Opus-4.8仅为25.7分。在ZeroBench上情况相同,35.0对比34.0,小模型胜出。别小瞧这一两个百分点的差距——这可是一家以性价比闻名的公司,其“Flash”级别的轻量模型,在多模态Agent赛道上正面战胜了目前公认最强的闭源模型。
更值得关注的是,在增添了视觉能力后,文本性能并未出现下降。这在多模态模型中实际上难以达成。许多模型在加入图片理解功能后,纯文本任务会呈现出不同程度的退化,就如同一个人同时学习两门外语,其母语水平反而有所降低。V4-Flash-Vision-Exp在Terminal Bench、DeepSWE、Toolathlon这些纯文本Agent基准测试上,成绩与V4-Flash-0731基本保持一致,其中DeepSWE的成绩甚至从54.4提升至59.3,Toolathlon的成绩从70.3提升至75.9。增添了视觉能力,其处理文本的能力也变得更加灵活高效。
这背后的技术逻辑值得拆解。V4-Flash本身就是Flash级别的轻量架构,推理速度快、成本低。在此基础上叠加视觉能力,每张图片最多消耗384个token,定价和纯文本V4-Flash一样。对比那些动辄上千token图片编码的大模型,这个成本控制相当激进。同时上线的Files API还是免费的——上传一次图片,拿到file_id,后续请求直接引用,不用反复传。这对需要处理大量图片的Agent工作流来说,省的不只是钱,还有延迟。
说到Agent工作流,这才是这次发布真正瞄准的战场。纯看聊天能力,多模态大模型早就够用了。但Agent需要的是"看懂图→理解意图→调用工具→完成任务"这条完整链路。V4-Flash-Vision-Exp在ApexBench上从26.2跳到36.5,涨幅接近40%,说明它不只是能看图,而是能把视觉信息有效地融入决策过程。官方演示里,模型分析一张复杂的西藏远征营销长图,从视觉元素到文案意图到营销策略,一气呵成。这种能力放在电商运营、数据分析、自动化办公这些场景里,实用价值远超聊天机器人。
当然也要说清楚局限。名字里带"Exp"不是客气,这确实还是实验版。在NL2Repo、DSBench-Hard这些任务上,和顶级闭源模型还有明显差距,Cybergym甚至比上一版微跌。Agent能力的全面提升不是一夜之间的事,但方向已经很清楚了。
我的判断是:V4-Flash-Vision-Exp的意义不在于全面超越谁,而在于证明了一件事——多模态Agent能力的门槛正在被迅速拉低。以前你想要这种级别的视觉理解和Agent协作,要么用顶级闭源模型烧钱,要么等开源社区慢慢追。现在一个Flash级别的模型就能做到,而且API定价没涨。这对整个行业的压力是实打实的:当小模型也能干大模型的活,靠卖算力赚钱的逻辑就要重新算账了。
同期发布的DeepSeek Harness 0.1.1也透露了野心——不只是做模型,还要做Agent开发的基础设施。模型加框架,这是要建生态的意思。
转发、点赞、收藏。
THANKS FOR READING
⚡ 爱马仕 · Hermes Agent 技术分享
登录查看剩余 70% 内容
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名