性能提升超两倍:英伟达发布 Nemotron-Labs-TwoTower 扩散语言模型
在提升大模型生成效率的赛道上,英伟达最近给出了一个值得关注的新思路。7月1日,这家公司正式开源了其最新推出的Nemotron扩散语言模型——「双塔」架构(Nemotron-Labs-TwoTower)。简单说,这个模型的核心目的,就是用架构创新去打破传统自回归(AR)模型长期以来面临的吞吐量瓶颈。
传统自回归模型生成文本时,是一个token一个token串行解码的,就像排队过安检,一个一个来。碰上大规模合成任务,这种逐字推进的方式效率就会拖后腿。英伟达的解法是:把任务拆成两路并行处理。一路是「上下文塔」,它保持冻结状态,专门负责处理提示词,守住原有的语言理解能力;另一路是「去噪器塔」,经过专项训练,专门用来并行生成并优化token。两塔各司其职,互不干扰。
这种设计的精妙之处在于,它在「质量」和「速度」之间找到了一个不错的平衡点。在2×H100 GPU的评测环境下,该模型在默认设置下成功保留了基线模型98.7%的生成质量,而实际生成吞吐量却直接翻了2.42倍。这意味着什么?对于需要批量生产合成文本的数据团队来说,这简直是一把兼具高性能与高效率的利器——省时,还不怎么掉品质。
具体到使用层面,这个模型也够灵活:它支持扩散模式、模拟AR和标准AR三种解码方式,开发者完全可以按任务需求自由切换。目前该模型已经以开放权重项目的形式发布,遵循NVIDIA Nemotron开放模型许可协议,并且完全支持商业用途——这一点对很多团队来说无疑是加分项。
当然,新东西总有些妥协。比如在代码生成和数学推理任务上,它相比原始基线有轻微的性能回落,同时对GPU显存也有一定要求。但瑕不掩瑜,它为大模型推理加速提供了一个极具潜力的技术方向。可以预见,随着人工智能应用向高频、大规模场景渗透,这种通过算法架构优化来换取生成速度的思路,正在成为模型研发的新趋势——甚至可能是下一轮竞争的胜负手。