首页 > 教程攻略 > ai资讯 >OLMoE,首个“完全开源”MOE模型,干货满满

OLMoE,首个“完全开源”MOE模型,干货满满

来源:互联网 时间:2026-08-27 14:22:13

MoE结构现在成了大模型领域的香饽饽,但要真正用好它,不少细节值得深究。最近看到一份61页的详细报告,信息量很大,里面有不少跟直觉不太一样的发现,挑几个有意思的跟大家聊聊。

先从性能说起。1B到7B规模的MoE模型与同等规模的Dense模型相比,起点明显更高,而且训练到后期,性能甚至能接近甚至超过7B的全量全参数Dense模型。这个结论相当直接,效果对比图也印证了这一点。

在专家组合的设计上,研究发现采用更细粒度的专家组合,确实能带来更低的训练损失,但收益是递减的。报告中还引用了不少相关研究,都在尝试预测最优的专家组合方式。

一个比较反直觉的结论是关于共享专家的。报告指出,共享专家会消除模型的灵活性,反而导致性能下降。这跟一些历史研究结论不太一致,值得关注。

在路由策略上,也就是如何决定每个输入token由哪些专家处理,主要存在两种方案:一种是EC(每个专家从输入序列中固定选择token数),另一种是TC(每个token固定选择若干个专家)。EC方式的优点是能完美实现负载平衡,但不适合自回归生成模式,还可能导致token丢失。而TC方式的问题是,许多token可能都选择同一个专家,影响训练效率。不过在相同预算下,实验结果显示TC稳定优于EC。

关于专家的初始化方式,是从头开始训练还是从MLP复制参数?实验表明,只需要几百B的训练数据,从头初始化的模型就能赶上复制参数的结果。而在超过600B的token后,从头训练的专家表现甚至反超了复制的版本。

负载平衡损失的应用也被证实能带来更好的性能。此外,路由z-loss这项技术值得留意——它通过惩罚进入门控网络的大logits值,能有效提升MoE模型的稳定性和质量。

还有几个训练过程中的现象很有意思。比如,在预训练的早期阶段,路由就已经达到了饱和状态。而训练结束后,同一层的专家之间并不存在强协同激活,也就是说不同专家之间几乎没有冗余。

最后,关于专家的专业化分工,报告发现区分度还是比较高的。有些专家专门处理科学相关的数据(比如arXiv数据集),另一些则更擅长编程语言或一般文本。这种专业化分工,恰恰是MoE结构能够高效处理多种任务的关键所在。