首页 > 教程攻略 > ai资讯 >DeepSeek-V2.5:融合通用与代码能力的全新开源模型

DeepSeek-V2.5:融合通用与代码能力的全新开源模型

来源:互联网 时间:2026-08-26 20:44:38

今天,我们正式将 DeepSeek-V2-Chat 和 DeepSeek-Coder-V2 两个模型合并,发布了全新的

DeepSeek-V2.5

。新模型不仅保留了 Chat 版本擅长的通用对话能力和 Coder 版本强大的代码处理能力,还在人类偏好对齐上下了不少功夫。写作任务、指令跟随等多个方面也有了显著提升。目前 DeepSeek-V2.5 已在网页端和 API 全面上线,API 接口向前兼容,通过 deepseek-coderdeepseek-chat 都可以直接使用。Function Calling、FIM 补全、Json Output 等功能保持不变。All-in-One 的设计让体验更简洁、智能、高效。

升级历史

DeepSeek 在模型改进上一向认真。6 月份,我们用 Coder V2 的 Base 模型替换了原有 Chat 的 Base 模型,对 DeepSeek-V2-Chat 做了次大升级,代码生成和推理能力明显提升,从而诞生了 DeepSeek-V2-Chat-0628。紧接着,DeepSeek-Coder-V2 通过进一步的对齐优化,通用能力大幅增强,推出了 0724 版本。最终,两个路线殊途同归——Chat 和 Coder 合并成现在的 DeepSeek-V2.5。

由于本次模型版本变动较大,如果遇到某些场景效果不如预期,可以尝试重新调整 System Prompt 和 Temperature,以获得最佳表现。

通用能力

通用能力测评

在业界常用的中英文测试集上,DeepSeek-V2.5 全面超越了之前的 DeepSeek-V2-0628 和 DeepSeek-Coder-V2-0724。内部中文评测中,与 GPT-4o mini、ChatGPT-4o-latest 的对战胜率(由 GPT-4o 担任裁判)相比 DeepSeek-V2-0628 也有明显提升。评测涵盖创作、问答等通用场景,实际体验会更好。

DeepSeek-v2.5 Preference Evaluation

安全能力测评

Safety 和 Helpful 之间的平衡一直是迭代中的重点。DeepSeek-V2.5 对安全问题边界做了更清晰的划分——强化了模型对各类越狱攻击的抵抗能力,同时又避免安全策略过度泛化到正常问题中。

*基于内部测试集合的得分,分数越高代表模型的整体安全性越高

**基于内部测试集合的得分,比例越低代表模型的安全策略对于正常问题的影响越小

代码能力

代码方面,DeepSeek-V2.5 保留了 DeepSeek-Coder-V2-0724 的强劲实力。在 HumanEval Python 和 LiveCodeBench(2024 年 1 月 - 9 月)测试中,V2.5 显示出明显改进。HumanEval Multilingual 和 Aider 测试中则略逊一筹。SWE-verified 上两个版本得分都不高,说明这块还有优化空间。值得一提的是,FIM 补全任务在内部评测集 DS-FIM-Eval 上得分提升了 5.1%,这意味着插件补全体验更流畅。同时,DeepSeek-V2.5 针对常见代码场景做了专项优化,在内部主观评测 DS-Arena-Code 中,对战竞品(GPT-4o 为裁判)的胜率显著提升。

模型开源

一如既往,秉承持久开源的精神,DeepSeek-V2.5 已开源至 HuggingFace:

https://huggingface.co/deepseek-ai/DeepSeek-V2.5


——end——