SuperCLUE 2026年7月评测:Qwen3.8-Max登顶,Kimi-K3智能体编程最强
2026年8月6日,SuperCLUE发布2026年7月中文大语言模型综合能力评测结果,共计12款国产主流模型参与本次评估。
综合总分排名揭晓,Qwen3.8-Max以71.48分强势领跑,Kimi-K3则以70.68分紧追不舍,两者分差仅0.8分,可谓毫厘之间。紧随其后的豆包Doubao-Seed-2.1-pro拿下65.95分位列第三,DeepSeek-V4-Flash以65.6分屈居第四,而DeepSeek-V4-Pro则以64.4分排在第五位。
这次评测对整体评估体系做了关键升级:不再沿用传统的代码生成任务作为核心考察项,而是全面切换到智能体编程能力测试,并将这一项的权重提高到25%。这么调整之后,模型在真实软件开发场景中的实际表现,也就能被更准确地体现出来。其余五项指标及对应权重分别是:数学推理(18%)、科学推理(16%)、精确指令遵循(16%)、幻觉控制(16%)、智能体任务规划(9%)。最终成绩则由这六大维度加权计算得出。
细分能力表现呈现明显差异化特征:在智能体编程维度,Kimi-K3以75.79分拔得头筹,展现出在工程化代码生成与多轮交互式开发中的突出优势;Qwen3.8-Max以68.42分位列第二。数学推理方面,DeepSeek-V4-Flash以78.95分领先;科学推理得分最高的是豆包Doubao-Seed-2.1-pro,达77.19分。幻觉控制与智能体任务规划两项中,Qwen3.8-Max显著领先,信息准确性高,复杂任务拆解能力更为成熟。
除综合能力外,推理效率与成本效益亦成为关键参考维度。DeepSeek-V4全系列模型整体处于高性价比区间,API调用价格合理,推理质量稳定;其中DeepSeek-V4-Flash、GLM-5.2与Hy3三款模型同时具备高效能特性,响应延迟低、计算耗时短。相较之下,综合得分位居前两位的Qwen3.8-Max与Kimi-K3虽在多项能力上表现优异,但单次推理响应时间偏长,属于低效能梯队,Kimi-K3的平均耗时甚至达到最快模型的三倍。
面向不同使用场景,模型选择建议如下:预算有限且需高频批量处理任务的开发者,可优先考虑DeepSeek系列;日常办公、内容创作及对信息真实性要求较高的用户,Qwen3.8-Max更为适配;而面向专业级工程开发、长期承担复杂编码任务的程序员,则Kimi-K3的交互体验与编程支持能力更具优势。