MOE vs MOT 让LLM更加有效
大语言模型的表现,与模型规模和可扩展性呈正相关,这已经是行业共识。但模型越做越大,成本也水涨船高——这成了整个领域面临的核心挑战。虽然
专家混合(Mixture of Experts,MoE)
令牌混合(Mixture of Tokens,MoT)
专家混合(Mixture of Experts)
专家混合(Mixture of Experts)
MoE之所以出名,是因为它显著优化了Transformer的可扩展性。要理解它,得先搞清楚这些“专家”到底是什么。在MoE架构中,专家就是专门执行某项或某几项任务的子模型。标准Transformer模型里,每个token都由统一的前馈层处理;MoE则不同,它通过一个被称为控制器的小型网络,将每个token定向到一组专家,确保每个token只由其中一小部分专家来处理。具体实现上,开关Transformer(Switch Transformer)会直接把每个token分配给控制器评分最高的那位专家。这项设计带来的效果很惊人:参数量可以从1.6T的T5模型,骤降至仅相当于1.4B标准Transformer的计算成本。
另一种变体叫“专家选择”,思路反过来——不是让token去选排名靠前的专家,而是让专家自己来挑选排名靠前的token。这种方法能天然保证负载均衡(每个专家处理的token数量相同),在训练效率和下游性能上都有明显提升。不过,它的代价是:有些token可能压根没被任何专家挑中。

当前方法的局限
当前方法的局限
大规模MoE架构的性能固然亮眼,但它在训练和推理环节也带来了一系列新挑战。最值得关注的几个问题包括:
训练不稳定性:
负载不平衡:
信息泄露:
知识混合性:
知识冗余:
针对上述问题,研究者们也在不断提出改进方案。Cohere AI的科学家们在近期论文中,就专门讨论了如何解决MoE的一大核心痛点——必须把所有专家都加载到内存里。他们的做法是:将MoE架构与轻量级专家独特地结合起来,提出了一种参数效率极高的MoE。这种架构不仅在性能上优于标准的PEFT方法,而且仅需更新轻量级专家,就能达到完全微调的效果——更新量还不到11B参数模型的1%。
解决MoE的局限
解决MoE的局限
还有一篇近期论文,专门针对MoE的后两个局限性(知识混合性和知识冗余性)给出了解决方案——那就是DeepSeekMoE。这个新架构通过两项关键策略来增强专家的专业化程度:
细粒度专家分割
共享专家隔离
细粒度专家分割
与此同时,
共享专家隔离

实际效果上,DeepSeekMoE扩展到16B模型进行训练时,仅需约40%的计算量,就能达到与DeepSeek 7B和LLaMA2 7B相当的性能。研究团队还计划将这一架构扩展到145B,进一步凸显它相对于GShard架构的优势,同时展示与DeepSeek 67B相当的性能水平。
令牌混合(Mixture of Tokens)
令牌混合(Mixture of Tokens)
MoE的上述缺陷,催生了令牌混合(MoT)这一新思路。MoT对方法的调整并不大,却有效解决了MoE带来的诸多问题。它的核心逻辑是:不再把token直接发给专家,而是先将不同样本中的token混合起来,再交给专家处理。这样一来,模型能从所有token-专家的组合中学习,显著提升训练稳定性和专家利用率。专家处理完混合后的token后,再把这些结果重新分配回原始的token上。
那么,token混合具体是怎么做的呢?首先,需要为每个token设定一个重要性权重。这一步由控制器完成,接着对生成的token分数执行softmax层操作。这样一来,每个专家对应的token权重就可以独立计算了。最后,每个token乘上自己的重要性权重,再全部加总在一起,就完成了混合。

MoT通过对以下几个方面的调整,解决了MoE模型的核心问题:
混合来自不同样本的token后再提供给专家——这使得模型能从所有token-专家的组合中学习,训练稳定性和专家利用率都得到了提升。
token混合过程是完全可以微分的——这意味着它能直接用标准的梯度方法进行训练,避免了辅助损失或其他难以训练的技术,训练和部署都变得更加简单。

结论
结论
令牌混合这项技术,有潜力显著提升大语言模型的表现和效率。从数据上看,与标准Transformer相比,它的训练时间缩短了整整3倍——这个结果相当惊人。可以预见,未来MoT还会带来更多实质性的改进。

-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名