Nemotron-Labs-TwoTower - 英伟达开源的双塔架构扩散语言模型
来源:互联网
时间:2026-07-03 14:42:15
Nemotron-Labs-TwoTower是什么
NVIDIA最近开源了一个很有意思的模型——Nemotron-Labs-TwoTower。它的总参数量大约60B,但靠MoE架构,实际活跃参数只有3B。这个模型最大的亮点,是把语言模型里的“上下文理解”和“去噪生成”这两个任务,拆给了两个独立的模块去干。一个叫上下文塔(Context Tower),专门处理干净的token,另一个叫去噪塔(Denoiser Tower),通过交叉注意力机制去精炼那些带噪声的token块。它基于Nemotron-3-Nano-30B-A3B构建,训练了约2.1T tokens,最终在保留自回归基线98.7%质量的前提下,生成吞吐量提升了2.42倍。它还支持Mask Diffusion、Mock-AR与AR-only三种推理模式,可以说是为高效推理而生。
Nemotron-Labs-TwoTower的主要功能
- :把上下文编码和去噪生成拆成两个独立模块,等于让专业的人干专业的事,避免了单一网络“身兼多职”时的性能瓶颈。
双塔分离推理
- :一个检查点,却能支持Mask Diffusion、Mock-AR与AR-only这三种模式,想怎么用就怎么用。
三种推理模式切换
- :在质量上几乎没打折扣,保留了自回归基线98.7%的聚合质量,同时还能享受并行迭代生成的好处。
高质量文本生成
- :在2×H100的环境下,生成吞吐量提升了2.42倍,这个提升对于降低推理延迟和计算成本来说,意义不小。
高吞吐生成加速
- :用的是NVIDIA Nemotron Open Model License,企业可以放心拿去商用和二次开发。
商用级开源部署
Nemotron-Labs-TwoTower的技术原理
- :过去的扩散语言模型,往往用一个网络同时扛起“上下文理解”和“迭代去噪”两副担子,结果两边都做不好。TwoTower的解法很简单——拆。上下文塔(Context Tower)用的是冻结的Nemotron-3-Nano-30B-A3B,靠因果注意力处理干净的token,负责高质量地编码上下文。而去噪塔(Denoiser Tower)则是可训练的,用双向块注意力处理带噪声的token块,再通过交叉注意力从上下文塔那边获取语义指导,逐步把噪声给去掉。
核心思想
- :模型基于30B混合Mamba-Transformer MoE骨架,在约2.1T tokens上完成训练。MoE的稀疏激活机制,也让计算效率高了不少。
训练方式
- :扩散模型天生就适合并行迭代加速,而双塔分离之后,去噪塔不用每次都重新编码一遍上下文,这样一来,在保证质量的同时,wall-clock吞吐量自然就上去了。
推理优势
如何使用Nemotron-Labs-TwoTower
- :直接打开Nemotron-Labs-TwoTower-30B-A3B-Base-BF16的官方仓库页面。
访问 HuggingFace 模型页
- :确认NVIDIA Nemotron Open Model License的商用条款,了解清楚模型架构和硬件要求。
阅读模型卡与许可
- :用
克隆/下载权重
git lfs或HuggingFace的transformers库下载模型权重和配置文件。 - :准备好至少2×H100 GPU的环境,安装好PyTorch和相关依赖(参考仓库里的
配置运行环境
requirements.txt)。 - :通过
加载模型与分词器
AutoModelForCausalLM和AutoTokenizer加载模型,然后选一种推理模式(Mask Diffusion / Mock-AR / AR-only)就行。 - :输入prompt,调用模型生成接口,双塔架构就会帮你完成高效的并行去噪生成。
执行推理生成
- :如果有自己的数据,可以对可训练的去噪塔进行微调,上下文塔保持冻结即可。
微调适配
Nemotron-Labs-TwoTower的核心优势
- :上下文编码和去噪生成各归各管,性能瓶颈自然就解决了。
双塔解耦,各司其职
- :保留了自回归基线98.7%的聚合基准质量,这说明扩散生成不再非得牺牲输出质量不可。
质量几乎无损
- :在2×H100环境下实现了2.42倍的wall-clock生成吞吐量,延迟和算力成本都降了下来。
推理速度翻倍
- :一个检查点就能支持三种推理方式,在不同延迟和质量需求的场景下,可以灵活切换。
一模型三模式
- :用NVIDIA Nemotron Open Model License发布,企业可以自由部署和进行商业二次开发。
开源可商用
Nemotron-Labs-TwoTower的项目地址
- :https://huggingface.co/collections/nvidia/nemotron-labs-twotower
HuggingFace模型库
- :https://arxiv.org/pdf/2606.26493
arXiv技术论文
Nemotron-Labs-TwoTower的同类竞品对比
这里拿它和MIT的LLaDA做个简单对比,结果一目了然:
| 对比维度 | Nemotron-Labs-TwoTower | LLaDA |
|---|---|---|
发布机构 | NVIDIA | MIT |
架构设计 | 双塔分离 | 单塔统一 |
总参数量 | ~60B(活跃3B,MoE稀疏) | 8B(稠密) |
基座模型 | Nemotron-3-Nano-30B-A3B(Mamba-Transformer MoE) | 自研Transformer |
训练数据 | ~2.1T tokens | ~2T tokens |
基线质量保留 | 98.7% | ~95%(相对同等规模AR模型) |
吞吐提升 | 2.42× | ~1.5×(标准GPU环境) |
推理模式 | 三种 | 单一 |
注意力机制 | 上下文塔:因果注意力;去噪塔:双向块注意力 + 交叉注意力 | 统一双向注意力 + 位置编码处理 |
核心创新 | 角色解耦 | 简单 scalable |
Nemotron-Labs-TwoTower的应用场景
- :2.42倍的吞吐提升,让它很适合搜索引擎、智能客服这类需要低延迟、高并发的实时文本生成场景。
高并发在线服务
- :扩散模型的并行迭代特性,对于长文本续写、报告生成、代码补全这类需要多步refine的任务,简直是天然优势。
长文档生成
- :三种推理模式切换,企业可以自己权衡成本和效果——边缘端用AR-only,云端用Mask Diffusion,灵活得很。
多模式灵活部署
- :可商用的许可,意味着企业可以把它集成到写作助手、营销文案生成器、代码辅助工具等产品里。
商用产品开发
- :开源权重加上详细的论文,对研究者探索扩散语言模型架构、训练策略以及跨模态扩展方向来说,都是很不错的资源。
科研与二次创新