Nemotron-Labs-Diffusion - 英伟达开源的三模式语言模型
来源:互联网
时间:2026-07-09 14:40:43
Nemotron-Labs-Diffusion是什么
NVIDIA最新推出的Nemotron-Labs-Diffusion,本质上是一个“三栖”语言模型——在一个架构里,同时整合了自回归、扩散和自我推测解码三种能力。它通过联合AR-扩散目标进行训练,可以在不同并发场景下自由切换模式,始终保持高吞吐量。目前这个系列包含3B、8B和14B三个参数量级的版本,每个都有基础版、指令版和视觉语言版。从准确率和速度两个维度看,它在现有开源的AR和扩散语言模型中都属于第一梯队。
Nemotron-Labs-Diffusion的主要功能
- :AR、扩散、自我推测三种解码模式,核心差异在于注意力模式,切换起来非常干净利落。
三模式解码切换
- :把序列切成块,在块内实现双向并行解码,单次前向就能生成多个token。
块级扩散并行生成
- :扩散模式负责并行生成多个token作为“草稿”,AR模式在同一模型内进行验证。共享KV缓存,不需要额外的预测头。
自我推测草稿验证
- :视觉语言模型变体可以理解图像并完成图文推理,多模态的边界被进一步拓宽。
视觉语言理解
- :支持FP8低精度格式,配合SGLang框架在GB200 GPU上实现高吞吐量服务。
高效推理部署
Nemotron-Labs-Diffusion的技术原理
技术层面,有几处设计非常关键。
联合AR-扩散目标训练
两阶段训练策略
结构化注意力模式
全局损失平均
最后是
最优采样与LoRA增强
如何使用Nemotron-Labs-Diffusion
- :运行
安装依赖
pip install "transformers>=5.0" torch peft等命令,准备好Python和GPU环境。 - :从HuggingFace拉取
获取模型
nvidia/Nemotron-Labs-Diffusion-8B等模型权重以及对应的分词器。 - :根据并发水平选择——高并发用AR模式、最大化并行用扩散模式、低延迟场景用自我推测模式。
选择模式
- :使用
运行脚本
chat_ar.py、chat_dlm.py或chat_linear_spec.py等官方脚本进行单轮或多轮对话。 - :基于SGLang框架启动推理服务,配置Linear Self-Speculation与FP8精度,可以接入生产环境。
服务部署
Nemotron-Labs-Diffusion的核心优势
- :单一模型同时掌握AR语言先验与扩散并行规划能力,不用再维护多套模型和管线。
三模式统一架构
- :8B模型单次前向解码的token数能达到Qwen3-8B的6倍,在GB200上SPEED-Bench吞吐量提升4倍。
吞吐量显著提升
- :自我推测模式的接受率和实际设备效率都比多token预测(MTP)方法更高。
自我推测优于MTP
- :全局损失平均与两阶段策略有效平衡了双目标梯度,避免了模式间的容量竞争。
双目标和谐训练
- :通过切换注意力模式就能适配云侧高并发和端侧低并发场景,不需要改造架构。
场景自适应切换
Nemotron-Labs-Diffusion的项目地址
- :https://huggingface.co/collections/nvidia/nemotron-labs-diffusion
HuggingFace模型库
- :https://arxiv.org/pdf/2607.05722
arXiv技术论文
Nemotron-Labs-Diffusion的同类竞品对比
- :低并发场景下用自我推测模式,实现低延迟交互式AI对话,提升用户体验。
实时对话助手
- :AR模式适配高并发批量请求,充分利用GPU计算密度,降低云端部署成本。
云推理服务
- :扩散模式增强前瞻规划,适合需要多步逻辑推导的编程辅助和数学求解任务。
代码与数学推理
- :8B模型可以在个人设备运行,三模式切换适配不同负载,保障数据隐私。
端侧本地推理
- :视觉语言模型变体支持图像理解与图文问答,适用于智能文档分析与多模态交互。
视觉语言应用
Nemotron-Labs-Diffusion的应用场景
- :低并发场景下使用自我推测模式,实现低延迟交互式AI对话,提升用户体验。
实时对话助手
- :AR模式适配高并发批量请求,充分利用GPU计算密度,降低云端部署成本。
云推理服务
- :扩散模式增强前瞻规划,适合需要多步逻辑推导的编程辅助和数学求解任务。
代码与数学推理
- :8B模型可以在个人设备运行,三模式切换适配不同负载,保障数据隐私。
端侧本地推理
- :视觉语言模型变体支持图像理解与图文问答,适用于智能文档分析与多模态交互。
视觉语言应用