轻量级冠军:NVIDIA 发布具有领先准确率的小语言模型
生成式AI领域,开发者们长期面临一个两难选择:模型要大、要准,还是小、要快?然而,Mistral AI与NVIDIA最近联手给出了一个打破常规的答案——一款尺寸迷你、但准确率却毫不妥协的新模型正式登场。
这就是
Mistral-NeMo-Minitron 8B
NVIDIA NeMo
NVIDIA应用深度学习研究副总裁Bryan Catanzaro对此解释道,他们巧妙地将两种不同的AI优化方法结合起来——先将Mistral NeMo的120亿参数剪枝到80亿,再通过蒸馏来弥补精度的损失。结果呢?Minitron 8B以更低的计算成本,实现了与原始模型相当的精度。
这与大语言模型不同,小语言模型可以直接在普通的工作站甚至笔记本电脑上实时运行。这意味着,即便是资源有限的企业,也能将生成式AI能力落地到现有基础设施中,同时兼顾成本、效率和能耗。更别提在边缘设备上本地运行带来的安全优势——数据无需离开设备,自然避免了传输过程中的风险。
开发者现在就可以上手体验了。Mistral-NeMo-Minitron 8B已经被打包成标准的
NVIDIA NIM

80亿参数模型的实力边界
在同级别的80亿参数模型中,Mistral-NeMo-Minitron 8B在九项主流语言模型性能基准测试中表现拔尖。它涵盖了语言理解、常识推理、数学推理、内容总结、代码生成以及事实准确性等关键维度——几乎覆盖了日常AI应用的方方面面。
值得留意的是,以NIM微服务形式打包的模型,专门针对低延迟和高吞吐量做了优化。低延迟意味着用户能更快获得响应,高吞吐量则意味着在生产环境中,计算效率更高。
另外,对于那些想在智能手机或机器人等嵌入式设备上跑模型的开发者,还有一个福音:他们可以先下载这个80亿参数模型,再借助
NVIDIA AI Foundry
AI Foundry平台本身提供了完整的全栈解决方案,集成了流行基础模型、NVIDIA NeMo平台以及
NVIDIA DGX Cloud
NVIDIA AI Enterprise
由于原始Mistral-NeMo-Minitron 8B模型已经以高精度为基础,经过AI Foundry进一步“缩水”后的版本,依然能够保持相当水准的准确性,这为用户带来了极大的灵活性。
剪枝与蒸馏:小而强的技术奥秘
为了让小模型也能达到高精度,团队采用了一套组合拳:剪枝加蒸馏。简单来说,剪枝就是去除那些对模型准确率贡献甚微的参数,从而缩小网络体积;而蒸馏,则是在剪枝之后,用小规模的数据集重新训练这个“瘦身版”模型,把剪枝过程中损失的准确率尽量补回来。
最终产出的是一个尺寸更小、效率更高,但预测能力却丝毫不逊于原版大模型的优质模型。
从成本角度看,这项技术意义重大。它只需要原始训练数据集的一小部分,就能完成系列模型中每个衍生版本的训练。相比从零开始训练一个小模型,通过剪枝和蒸馏大模型的方式,最多可将计算成本降低到原来的四十分之一。这才是关键所在。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名