首页 > 教程攻略 > ai资讯 >MOE vs MOT 让LLM更加有效

MOE vs MOT 让LLM更加有效

来源:互联网 时间:2026-08-03 13:53:01

大语言模型的表现,与模型规模和可扩展性呈正相关,这已经是行业共识。但模型越做越大,成本也水涨船高——这成了整个领域面临的核心挑战。虽然

专家混合(Mixture of Experts,MoE)

近来被频繁提及,被视为优化Transformer的有效手段,但机器学习研究者们已经发现了一种更有潜力的新方向——

令牌混合(Mixture of Tokens,MoT)

。MoE在实践中暴露出的某些短板,恰好催生了这条新路径。这篇文章就来聊聊这些技术思路,看看MoT如何在控制训练和推理成本的前提下,为扩展大语言模型提供新的可能性。

专家混合(Mixture of Experts)

MoE之所以出名,是因为它显著优化了Transformer的可扩展性。要理解它,得先搞清楚这些“专家”到底是什么。在MoE架构中,专家就是专门执行某项或某几项任务的子模型。标准Transformer模型里,每个token都由统一的前馈层处理;MoE则不同,它通过一个被称为控制器的小型网络,将每个token定向到一组专家,确保每个token只由其中一小部分专家来处理。具体实现上,开关Transformer(Switch Transformer)会直接把每个token分配给控制器评分最高的那位专家。这项设计带来的效果很惊人:参数量可以从1.6T的T5模型,骤降至仅相当于1.4B标准Transformer的计算成本。

另一种变体叫“专家选择”,思路反过来——不是让token去选排名靠前的专家,而是让专家自己来挑选排名靠前的token。这种方法能天然保证负载均衡(每个专家处理的token数量相同),在训练效率和下游性能上都有明显提升。不过,它的代价是:有些token可能压根没被任何专家挑中。

MoE 方法:从左到右:标准前馈、开关、专家选择

当前方法的局限

大规模MoE架构的性能固然亮眼,但它在训练和推理环节也带来了一系列新挑战。最值得关注的几个问题包括:

训练不稳定性:

这种机制需要精心地将专家和token匹配起来。问题在于,控制器权重的微小波动,都可能对最终决策产生不成比例的影响。

负载不平衡:

路由网络的选择缺乏有效约束,导致token和专家之间的分配很难做到均衡。结果就是,有些token找不到专家处理(token丢弃),而几乎所有token又都集中到了少数几个专家身上(模型崩溃)。

信息泄露:

一些效果不错的MoE方法,会把序列中不同位置的token放在一起处理(比如通过比较批次里所有token的分数)。这会引发序列内的信息泄露,限制了它们在自回归解码场景中的实用性。

知识混合性:

传统MoE架构中,由于专家数量有限,每个专家通常不得不积累过于宽泛的知识。知识面太广,反过来削弱了个别专家的专业性和有效性。

知识冗余:

多个专家在学习相似信息时容易趋同,导致知识领域相互重叠,模型参数的使用效率大打折扣。

针对上述问题,研究者们也在不断提出改进方案。Cohere AI的科学家们在近期论文中,就专门讨论了如何解决MoE的一大核心痛点——必须把所有专家都加载到内存里。他们的做法是:将MoE架构与轻量级专家独特地结合起来,提出了一种参数效率极高的MoE。这种架构不仅在性能上优于标准的PEFT方法,而且仅需更新轻量级专家,就能达到完全微调的效果——更新量还不到11B参数模型的1%。

解决MoE的局限

还有一篇近期论文,专门针对MoE的后两个局限性(知识混合性和知识冗余性)给出了解决方案——那就是DeepSeekMoE。这个新架构通过两项关键策略来增强专家的专业化程度:

细粒度专家分割

共享专家隔离

细粒度专家分割

,指的是对FFN的中间隐藏维度进行细分,让细粒度专家之间能够更细致地分配知识。每个专家因此可以专注于更具体的知识领域,在计算成本不变的前提下,实现更高水平的专业化。

与此同时,

共享专家隔离

策略会指定一部分专家作为“共享专家”,专门负责捕捉不同情境下的共同知识。通过把通用知识集中到这些共享专家身上,其他专家在学习过程中的冗余就大大减少了。这种方法提升了参数效率,也确保了每位专家始终聚焦于独特且专属的知识领域。

DeepSeekMoE。在这三种架构中,专家参数的数量和计算成本保持不变

实际效果上,DeepSeekMoE扩展到16B模型进行训练时,仅需约40%的计算量,就能达到与DeepSeek 7B和LLaMA2 7B相当的性能。研究团队还计划将这一架构扩展到145B,进一步凸显它相对于GShard架构的优势,同时展示与DeepSeek 67B相当的性能水平。

令牌混合(Mixture of Tokens)

MoE的上述缺陷,催生了令牌混合(MoT)这一新思路。MoT对方法的调整并不大,却有效解决了MoE带来的诸多问题。它的核心逻辑是:不再把token直接发给专家,而是先将不同样本中的token混合起来,再交给专家处理。这样一来,模型能从所有token-专家的组合中学习,显著提升训练稳定性和专家利用率。专家处理完混合后的token后,再把这些结果重新分配回原始的token上。

那么,token混合具体是怎么做的呢?首先,需要为每个token设定一个重要性权重。这一步由控制器完成,接着对生成的token分数执行softmax层操作。这样一来,每个专家对应的token权重就可以独立计算了。最后,每个token乘上自己的重要性权重,再全部加总在一起,就完成了混合。

令牌混合:每个专家的令牌都是唯一混合的(混合权重由控制器决定,为简单起见,此处省略),然后处理每个混合物并将其重新分配回原始令牌(使用与之前相同的权重)。

MoT通过对以下几个方面的调整,解决了MoE模型的核心问题:

  1. 混合来自不同样本的token后再提供给专家——这使得模型能从所有token-专家的组合中学习,训练稳定性和专家利用率都得到了提升。

  2. token混合过程是完全可以微分的——这意味着它能直接用标准的梯度方法进行训练,避免了辅助损失或其他难以训练的技术,训练和部署都变得更加简单。

MoE 与 MoT:在专家混合中(左),每个令牌都被路由到不同的专家前馈层。在令牌混合(右)中,每组内的令牌被混合,并且混合令牌由专家前馈层处理。

结论

令牌混合这项技术,有潜力显著提升大语言模型的表现和效率。从数据上看,与标准Transformer相比,它的训练时间缩短了整整3倍——这个结果相当惊人。可以预见,未来MoT还会带来更多实质性的改进。

MoTs 仅用 1/4 的步数和 1/3 的训练时间就减少了密集香草 Transformer 的最终训练损失,预计未来将显着改善。