Instella-MoE:AMD开源的端到端混合专家大语言模型
一、Instella-MoE是什么
AMD AGI团队最近开源了一个很有意思的项目——
Instella-MoE
Instella-MoE-16B-A3B-Think
完整释放了从数据预处理、预训练、微调、强化学习、模型蒸馏到高性能推理的全链路工程代码
协议区分:训练与推理源代码采用MIT协议;模型权重遵循ResearchRAIL协议,
。仅限学术研究用途

四、应用场景
学术科研场景
MoE稀疏大模型算法研究、长上下文大模型训练方案复现、分布式MoE通信优化实验、大模型对齐技术研究。长文本处理场景
超长文档摘要、法律文书解析、完整代码库读取、长篇资料问答。代码与数理推理场景
代码编写、逻辑推理、数学计算、复杂问题分步思考。硬件适配研究
AMD ROCm生态下大模型迁移、MI系列GPU稀疏模型性能调优、脱离CUDA的大模型工程实践。
限制:权重协议约束,不可直接用于商用产品落地,仅允许学术研究。
五、使用方法
5.1 环境准备
项目推荐使用官方预构建容器镜像:
训练镜像:
rocm/megatron-lm推理 & 强化学习镜像:
rlsys/miles:rocm7-mi300-sglangxxx
运行环境要求:AMD Instinct MI300X/MI325X,ROCm 7.0及以上版本。
5.2 训练流程
仓库training/目录提供全套脚本:支持原始JSONL语料分词预处理、预训练、长上下文拓展、SFT、DPO训练;同时提供Checkpoint权重合并工具。强化学习相关脚本存放于rl/目录,用于IF-RL、MOPD蒸馏实验。
5.3 推理部署
进入inference/文件夹,依托SGLang加载模型权重,内置对话模板,支持两种方式:
Hugging Face Transformers原生加载测试
SGLang高性能批量推理与自动化基准评测
5.4 快速验证
仓库附带Mock测试脚本,无需完整权重,可先行验证代码链路是否正常运行。
六、竞品对比
选取同类型开源MoE大模型进行横向对比
| 项目 | Instella-MoE-16B-A3B-Think | DeepSeek-V3 | Qwen-MoE |
|---|---|---|---|
| 开发厂商 | AMD AGI团队 | 深度求索 | 阿里通义千问 |
| 硬件生态 | 原生ROCm,适配AMD MI系列GPU,无CUDA依赖 | 优先NVIDIA CUDA,ROCm兼容性有限 | 优先CUDA,支持部分AMD环境 |
| 激活参数 | 2.8B(总参16B) | 3.7B(总参67B) | 4B(总参56B) |
| 上下文窗口 | 64k | 128k | 128k |
| 开源范围 | 训练+微调+RL+推理全链路代码开放 | 仅开放推理权重,完整训练代码未开源 | 开放基座权重,训练链路不完全开放 |
| 核心优化 | FarSkip通信优化、Gated MLA | 多头潜在注意力MLA | 改进型MoE路由均衡策略 |
| 权重协议 | ResearchRAIL(仅限科研) | 非商用协议 | Apache 2.0(可商用) |

七、常见问题解答
Q:Instella-MoE模型权重可以直接用于商业产品开发吗?
A:不可以。模型权重采用ResearchRAIL协议,仅支持学术研究使用;项目源代码为MIT协议,代码可自由修改使用,但使用权重需要遵守权重独立许可。
Q:没有AMD MI300X显卡,可以运行Instella-MoE吗?
A:普通消费级AMD显卡可尝试推理测试,但训练流程针对MI300X/MI325X加速卡深度优化,消费卡不推荐开展完整训练任务,存在性能异常、显存不足问题。NVIDIA显卡缺少原生ROCm支持,运行会存在大量适配工作量,官方不提供相关兼容方案。
Q:FarSkip-Collective可以移植到其他MoE模型上使用吗?
A:代码模块独立实现,理论上可以迁移至其他MoE架构;但是该方案针对AMD集群通信特性优化,迁移后需要重新调试分布式通信逻辑。
Q:Instella-MoE和普通稠密LLM相比优势在哪里?
A:相同算力条件下,MoE架构依靠稀疏激活,能够使用更大总参数量模型;Instella-MoE仅激活2.8B参数就能逼近更大稠密模型能力,适合追求推理成本控制、长文本处理的研究场景。
Q:是否提供中文专项优化版本?
A:官方基础模型无单独中文微调版本,基础预训练语料包含多语言文本,有需求可基于开放SFT脚本自行开展中文指令微调。
八、相关链接
GitHub仓库地址:https://github.com/AMD-AGI/Instella-MoE
Hugging Face模型库:https://huggingface.co/collections/amd/instella-moe
九、总结
综合来看,Instella-MoE是AMD推出的一套软硬协同、全链路开源混合专家大模型解决方案。它不仅开放了16B总参、2.8B激活参数、支持64k上下文的MoE模型权重,同时完整公开了从数据处理、多阶段训练、强化学习蒸馏到高性能推理的全套工程代码。搭配自研Gated MLA与FarSkip-Collective技术,有效优化了长上下文计算与MoE分布式通信瓶颈,依托ROCm生态彻底摆脱CUDA依赖。对于研究人员来说,这是一套可完整复现、适配AMD高端加速卡的稀疏大模型实验底座,可以说是MoE大模型科研领域一个非常值得关注的开源项目。