NVIDIA 推出世界上最强大的人工智能芯片 Blackwell B200
2024年3月的GTC大会上,NVIDIA正式亮出了新一代Blackwell架构GPU。这个架构的名字来自数学家Da vid Harold Blackwell——一位在统计学、概率论和信息论领域留下深刻印记的学者。Blackwell定理和足够性原理至今仍是现代统计理论的基石。用他的名字命名,倒也恰如其分:这款芯片注定要成为AI计算新范式的奠基者之一。
Blackwell架构产品线一览
黄仁勋在发布会上重点介绍了B200、B100以及GB200三款产品。这一代统一采用台积电4NP工艺,计算芯片集成了1040亿个晶体管——相比上一代GH100的800亿个,又是一次飞跃。各型号的具体区别,看下面这张图就一目了然:

简单来说,B100可以视为B200的“青春版”。它在Blackwell家族中主打性价比,一个关键特征是功耗维持在700W,和H100一致。这意味着跑训练时,降频几乎是必然的——想要马儿跑又不让马儿吃草,哪有这么好的事。
而两颗B200加上一颗Grace CPU,就组成了GB200。这套组合能在LLM推理工作负载上提供30倍的性能加速。

一个GB200包含两个B100和一个Grace CPU。
NVIDIA给出的对比数据相当震撼:训练一个1.8万亿参数的模型,之前需要8000个Hopper GPU和15兆瓦功率;而现在,2000个Blackwell GPU就能搞定,功耗仅需4兆瓦。效率提升不是一星半点。
GB200 NVL72:液冷机架服务器
黄仁勋还发布了服务器级的GB200 NVL72——由36个Grace CPU和72个Blackwell GPU组合而成,全部塞进一个液冷机架里。整套系统算力高达720 petaflops。机架内部用了近两英里长的电缆,整整5000根。这已经不是服务器,是小型数据中心了。

GB200 NVL72
目前,亚马逊、谷歌、微软和甲骨文都已计划在自己的云服务中部署NVL72机架。不过具体能拿到多少,很大程度上取决于台积电的产能——这始终是绕不开的瓶颈。
更高一级的是DGX Superpod:GB200 SuperPod由8个NVL72组成,总共576个Blackwell GPU。

第二代Transformer引擎与FP4精度
Blackwell GPU的一项关键改进是第二代Transformer引擎。它引入了FP4精度,能显著提升计算效率、带宽和模型规模。不过话说回来,官网宣传得天花乱坠,实际落地还有相当长的路要走。要知道,连FP8精度目前都还没得到广泛普及。国内LLM公司里,公开宣布使用FP8的目前只有零一万物一家。

FP8采用E4M3和E5M2两种表示方式——E代表指数位,M代表尾数位。在表示范围内,E4M3更精准,E5M2则有更宽的动态范围。相比传统的FP16和FP32,它显著减少了存储需求,提高了计算吞吐量。

定价与交付预期
黄仁勋透露,B200的售价可能在3万到4万美元之间。这个定价低于不少分析师此前的预期。显然,黄仁勋希望用更有竞争力的价格吸引更多客户。
目前英伟达正与台积电合作,试图避免芯片封装瓶颈——正是这个瓶颈导致上一代H100的出货速度严重放缓。虽然黄仁勋预计B200会在2024年晚些时候开始发货,但从英伟达一向的跳票习惯来看,正式交付很可能要等到明年上半年。这也给刚上市的H200留出了一段流通时间——否则大家都直接跳过去买B200了。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名