Hy3 - 腾讯混元开源的混合专家模型
来源:互联网
时间:2026-07-07 14:59:24
先说说最近的一个大新闻:腾讯混元正式开源了他们的Hy3模型。如果你关注过大模型圈子,可能会对MoE(混合专家)架构不陌生。Hy3是一个295B参数的MoE模型,规模不小,但也有意思的是,它的激活参数只有21B,算下来实际调度成本并不高。
这款模型在Agent能力、推理和长上下文任务上的进步非常明显。有多项基准测试显示,它的表现已经能与参数规模大2到5倍的旗舰模型一较高下。更值得留意的是,通过强化后训练和精细的数据清洗,Hy3的幻觉率从12.5%降到了5.4%,常识错误率也从25.4%降到了12.7%。这意味着,在回答内容可靠性和用户信任感上,它确实比多数同尺寸模型更有底气。
在实际应用层面,Hy3已经覆盖了代码开发、办公自动化、前端设计等多个生产力场景。至少从公布的数据来看,它在性价比上算是一个相当可靠的选择。
Hy3的主要功能
那Hy3到底能干什么?我们可以从几个关键维度来看:
- :这算是它的核心看点。在推理、智能体、长上下文等任务上,性能提升明显,多项基准测试数据已经比肩那些参数规模大2到5倍的旗舰模型。
智能体任务
- :支持软件开发、前端设计、CI/CD等典型任务。在SWE-bench系列基准上的成绩比较突出。
代码开发
- :这一点可能更贴近日常。它支持Excel建模分析、PPT制作、复杂数据汇总以及联动公式计算等办公场景,算是真正干活的工具。
办公生产
- :增强了工具调用的稳定性,同时跨不同脚手架的泛化能力也有提升,像Codebuddy、Cline、KiloCode这些工具都可以正常接入。
工具调用
- :通过细粒度数据清洗和训练约束,大幅降低了模型产生无依据答案的风险。这个前面提过,数据很具体:幻觉率5.4%,常识错误率12.7%。
抗幻觉
- :优化了指代消解、省略还原以及多轮约束继承等问题。简单说,就是长对话中它能保持上下文一致性,不会“前言不搭后语”。
多轮对话
Hy3的技术原理
支撑这些能力的,是几个关键的技术优化方向:
- :在preview版本的基础上,大幅提升了后训练数据的质量和多样性,同时扩大了RL(强化学习)的算力投入。这一步直接带来了推理能力的跃升。
后训练优化
- :在SFT(监督微调)和RL这两个阶段,联合优化了包括指代消解、省略还原以及多轮约束继承等实际业务中容易出问题的能力点。意思是,它不仅要懂语言,还得懂场景。
联合训练
- :这是抗幻觉的关键步骤。遵循的原则很直接:“有依据才回答,无依据明示缺失”。通过细粒度的清洗,减少了模型“硬编”答案的倾向。
数据清洗
- :这个部分可能不那么显眼,但同样重要。通过软件和硬件层面的联合优化,把推理成本降了下来,同时提升了Token的生成效率。
软硬协同
如何使用Hy3
如果你想亲自试试Hy3,操作路径很清晰:
- :直接去GitHub或HuggingFace,下载模型权重和代码即可。
获取模型权重
- :如果你不想自己部署,可以在腾讯云控制台开通Hy3的API服务。拿到访问密钥后,通过接口调用就能直接开始用。
开通API服务
- :无论本地还是云端,配置好运行环境后,把模型加载进来,再接入Codebuddy、Cline或KiloCode这些脚手架工具就行。
配置运行环境
- :无论是通过API还是本地部署,都可以完成代码开发、办公自动化、数据分析等任务。注意,环境和框架要匹配好。
调用完成任务
Hy3的核心优势
归纳下来,Hy3的核心竞争力主要体现在四个方面:
- :同尺寸模型里,智能水平有明显差距,多项基准已经比肩参数规模大2到5倍的旗舰模型。
性能越级
- :数据说话。幻觉率从12.5%降到5.4%,常识错误率从25.4%降到12.7%,多轮问题率从17.4%降到7.9%。这几个数字都意味着,在关键场景中,模型的“可信度”大幅提升。
体验可靠
- :这里有一个很关键的数据:跨不同脚手架(SWE Bench Verified)的分数标准差控制在4个百分点以内。这意味着无论你换什么工具,模型的表现都比较稳定,工具调用错误恢复能力也更强。
工具稳定
- :API的定价是输入1元/百万Tokens、输出4元/百万Tokens。缓存命中时,输入仅0.25元/百万Tokens。在办公任务上,Token消耗比竞品低出约47%到49%,这个成本优势在长期使用中非常可观。
成本低廉
Hy3的项目地址
- :https://hy.tencent.com/research/hy3
项目官网
- :https://github.com/Tencent-Hunyuan/Hy3
GitHub仓库
- :https://huggingface.co/tencent/Hy3
HuggingFace模型库
Hy3的同类竞品对比
既然是开源模型,自然免不了要和市场上的同类产品做个对比。这里就拿DeepSeek-V4 pro来做个参照,看看Hy3的定位是什么水平。
| 对比维度 | Hy3 | DeepSeek-V4 pro |
|---|---|---|
| 模型架构 | 295B MoE,21B 激活参数 | 671B MoE,37B 激活参数 |
| 开源协议 | Apache 2.0 | MIT(开源可商用) |
| SWE-bench Verified | 78.0 | 80.6 |
| Terminal Bench 2.1 | 71.7 |
64.0* |
| BrowseComp | 84.2 |
83.4 |
| MCP Atlas (public) | 79.1 |
73.6* |
| ClawEval (pass*3) | 68.5 |
58.4/62.1* |
| SkillsBench (text-only) | 55.3 |
40.5* |
| HLE (with tools, text-only) | 53.2 |
48.2 |
| AA-LCR | 73.4 |
71.3* |
从表格中可以看到,虽然Hy3的参数规模更小,但在多个关键基准上表现反而领先。尤其在Terminal Bench、MCP Atlas、ClawEval等智能体任务场景中,优势相当明显。这个结果传递出的信号是:模型能力的强弱,参数规模不是唯一的决定因素。
Hy3的应用场景
最后来看它适合用在哪些具体场景里:
- :支持代码生成、调试以及CI/CD流程自动化。在SWE-bench等标准基准上表现不错,适合拿来辅助开发团队提高效率。
软件开发
- :Excel建模分析、PPT制作、复杂数据汇总与联动公式计算都能搞定——说白了,就是帮你省下大量日常重复劳动。
办公自动化
- :它能够生成可以直接运行的HTML网页和浏览器插件这类前端代码,对设计或产品团队来说,这算是个很趁手的工具。
前端设计
- :在AI分身与客服场景中,它能处理不完整的表达,并结合上下文做出合理的判断。对服务型企业来说,这能显著提升交互的自然度和响应质量。
智能客服
- :支持游戏逻辑编写,并且可以接入游戏助手。官方提到《流放之路:降临》的AI助手就是其中之一,说明在游戏圈里它已经有实际落地。
游戏开发