AMD发布全开源MoE大模型Instella-MoE,16B参数规模挑战主流开源模型
来源:互联网
时间:2026-07-25 13:17:05
7月25日,AMD正式发布了一款全开源混合专家模型(MoE),名为Instella-MoE。这个模型的总参数量达到160亿,但每次处理任务时只激活28亿参数,设计思路更偏向效率优先。AMD表示,Instella-MoE完全基于自家Instinct MI300X和MI325X GPU以及ROCm软件栈从头训练,并引入了Gated Multi-head Latent Attention(Gated MLA)和FarSkip-Collective等架构创新,目标是提升训练和推理的速度。在性能测试中,Instella-MoE-16B-A3B基础模型平均得分达到76.7分,在同级别开源模型里表现靠前,超过了SmolLM3-3B、OLMo-3-7B等模型,仅靠28亿激活参数就能与一些规模更大的模型竞争。

除了技术细节,这款模型还支持64K Token的长上下文处理,并且完整经历了预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)以及强化学习(RL)等整个训练流程。AMD这次同步公开了Instella-MoE的全部模型权重、训练配置、数据配比、中间检查点以及推理代码,目的是让研究者和开发者能够复现并继续推进研究。AMD方面表示,Instella-MoE证明了他们用自家硬件和开放软件生态也能训练出大规模MoE模型,未来还会继续研发更大规模、推理能力更强、效率更高的开源语言模型。需要特别说明的是,本文仅供学习参考,不构成任何投资建议、交易建议或收益承诺。加密货币和迷因币市场波动较大,价格预测及市场数据请以官方公告、交易所页面及实时行情平台为准。投资者应独立判断、谨慎决策。