首页 > 教程攻略 > ai资讯 >Nemotron-Labs-TwoTower - 英伟达开源的双塔架构扩散语言模型

Nemotron-Labs-TwoTower - 英伟达开源的双塔架构扩散语言模型

来源:互联网 时间:2026-07-03 14:42:15

Nemotron-Labs-TwoTower是什么

NVIDIA最近开源了一个很有意思的模型——Nemotron-Labs-TwoTower。它的总参数量大约60B,但靠MoE架构,实际活跃参数只有3B。这个模型最大的亮点,是把语言模型里的“上下文理解”和“去噪生成”这两个任务,拆给了两个独立的模块去干。一个叫上下文塔(Context Tower),专门处理干净的token,另一个叫去噪塔(Denoiser Tower),通过交叉注意力机制去精炼那些带噪声的token块。它基于Nemotron-3-Nano-30B-A3B构建,训练了约2.1T tokens,最终在保留自回归基线98.7%质量的前提下,生成吞吐量提升了2.42倍。它还支持Mask Diffusion、Mock-AR与AR-only三种推理模式,可以说是为高效推理而生。

Nemotron-Labs-TwoTower的主要功能

  • 双塔分离推理

    :把上下文编码和去噪生成拆成两个独立模块,等于让专业的人干专业的事,避免了单一网络“身兼多职”时的性能瓶颈。
  • 三种推理模式切换

    :一个检查点,却能支持Mask Diffusion、Mock-AR与AR-only这三种模式,想怎么用就怎么用。
  • 高质量文本生成

    :在质量上几乎没打折扣,保留了自回归基线98.7%的聚合质量,同时还能享受并行迭代生成的好处。
  • 高吞吐生成加速

    :在2×H100的环境下,生成吞吐量提升了2.42倍,这个提升对于降低推理延迟和计算成本来说,意义不小。
  • 商用级开源部署

    :用的是NVIDIA Nemotron Open Model License,企业可以放心拿去商用和二次开发。

Nemotron-Labs-TwoTower的技术原理

  • 核心思想

    :过去的扩散语言模型,往往用一个网络同时扛起“上下文理解”和“迭代去噪”两副担子,结果两边都做不好。TwoTower的解法很简单——拆。上下文塔(Context Tower)用的是冻结的Nemotron-3-Nano-30B-A3B,靠因果注意力处理干净的token,负责高质量地编码上下文。而去噪塔(Denoiser Tower)则是可训练的,用双向块注意力处理带噪声的token块,再通过交叉注意力从上下文塔那边获取语义指导,逐步把噪声给去掉。
  • 训练方式

    :模型基于30B混合Mamba-Transformer MoE骨架,在约2.1T tokens上完成训练。MoE的稀疏激活机制,也让计算效率高了不少。
  • 推理优势

    :扩散模型天生就适合并行迭代加速,而双塔分离之后,去噪塔不用每次都重新编码一遍上下文,这样一来,在保证质量的同时,wall-clock吞吐量自然就上去了。

如何使用Nemotron-Labs-TwoTower

  • 访问 HuggingFace 模型页

    :直接打开Nemotron-Labs-TwoTower-30B-A3B-Base-BF16的官方仓库页面。
  • 阅读模型卡与许可

    :确认NVIDIA Nemotron Open Model License的商用条款,了解清楚模型架构和硬件要求。
  • 克隆/下载权重

    :用git lfs或HuggingFace的transformers库下载模型权重和配置文件。
  • 配置运行环境

    :准备好至少2×H100 GPU的环境,安装好PyTorch和相关依赖(参考仓库里的requirements.txt)。
  • 加载模型与分词器

    :通过AutoModelForCausalLMAutoTokenizer加载模型,然后选一种推理模式(Mask Diffusion / Mock-AR / AR-only)就行。
  • 执行推理生成

    :输入prompt,调用模型生成接口,双塔架构就会帮你完成高效的并行去噪生成。
  • 微调适配

    :如果有自己的数据,可以对可训练的去噪塔进行微调,上下文塔保持冻结即可。

Nemotron-Labs-TwoTower的核心优势

  • 双塔解耦,各司其职

    :上下文编码和去噪生成各归各管,性能瓶颈自然就解决了。
  • 质量几乎无损

    :保留了自回归基线98.7%的聚合基准质量,这说明扩散生成不再非得牺牲输出质量不可。
  • 推理速度翻倍

    :在2×H100环境下实现了2.42倍的wall-clock生成吞吐量,延迟和算力成本都降了下来。
  • 一模型三模式

    :一个检查点就能支持三种推理方式,在不同延迟和质量需求的场景下,可以灵活切换。
  • 开源可商用

    :用NVIDIA Nemotron Open Model License发布,企业可以自由部署和进行商业二次开发。

Nemotron-Labs-TwoTower的项目地址

  • HuggingFace模型库

    :https://huggingface.co/collections/nvidia/nemotron-labs-twotower
  • arXiv技术论文

    :https://arxiv.org/pdf/2606.26493

Nemotron-Labs-TwoTower的同类竞品对比

这里拿它和MIT的LLaDA做个简单对比,结果一目了然:

对比维度Nemotron-Labs-TwoTowerLLaDA

发布机构

NVIDIAMIT

架构设计

双塔分离

:冻结AR上下文塔 + 可训练扩散去噪塔(交叉注意力连接)

单塔统一

:单一Transformer同时承担上下文编码与掩码去噪

总参数量

~60B(活跃3B,MoE稀疏)8B(稠密)

基座模型

Nemotron-3-Nano-30B-A3B(Mamba-Transformer MoE)自研Transformer

训练数据

~2.1T tokens~2T tokens

基线质量保留

98.7%

(相对自回归基线)
~95%(相对同等规模AR模型)

吞吐提升

2.42×

(2×H100,wall-clock)
~1.5×(标准GPU环境)

推理模式

三种

:Mask Diffusion / Mock-AR / AR-only

单一

:掩码扩散(随机/半自回归采样)

注意力机制

上下文塔:因果注意力;去噪塔:双向块注意力 + 交叉注意力统一双向注意力 + 位置编码处理

核心创新

角色解耦

:避免单一网络“身兼两职”的性能瓶颈

简单 scalable

:证明扩散模型可scale至8B并逼近GPT-4质量

Nemotron-Labs-TwoTower的应用场景

  • 高并发在线服务

    :2.42倍的吞吐提升,让它很适合搜索引擎、智能客服这类需要低延迟、高并发的实时文本生成场景。
  • 长文档生成

    :扩散模型的并行迭代特性,对于长文本续写、报告生成、代码补全这类需要多步refine的任务,简直是天然优势。
  • 多模式灵活部署

    :三种推理模式切换,企业可以自己权衡成本和效果——边缘端用AR-only,云端用Mask Diffusion,灵活得很。
  • 商用产品开发

    :可商用的许可,意味着企业可以把它集成到写作助手、营销文案生成器、代码辅助工具等产品里。
  • 科研与二次创新

    :开源权重加上详细的论文,对研究者探索扩散语言模型架构、训练策略以及跨模态扩展方向来说,都是很不错的资源。