首页 > 教程攻略 > ai资讯 >H100/A100/4090/A10 实测性能(算力篇)

H100/A100/4090/A10 实测性能(算力篇)

来源:互联网 时间:2026-08-25 14:11:40

先说说背景。想必各位也清楚,由于某些众所周知的原因,像H100、A100这类GPU,在部分地区根本找不到正规的购买渠道和售后保障。从那些“奇怪的渠道”入手,翻新货、假货的概率可不低。对于搞计算用的GPU,咱们最关心的无非是三个硬指标:峰值算力、显存带宽、通信带宽。只要实测下来这三项跟理论值能对上,基本就算安全下车了。这次打算分三篇,分别聊聊每个指标怎么测。今天这篇,先聊聊算力。

H100/A100/4090/A10 实测性能(算力篇)

想快速又相对准确地测出实际峰值算力,最省事的办法是用CUTLASS profiler提供的GEMM算子来跑。道理很简单:GEMM本身是典型的计算密集型算子,而且当下最火的Transformer模型,核心负载基本上也都是GEMM。所以,用GEMM跑出来的最优性能,基本就可以当作GPU的实际峰值算力了。操作方法也不复杂:先从GitHub上NVIDIA的CUTLASS仓库把源码克隆下来,然后照着文档里的说明编译出cutlass_profiler这个程序就行。具体用法用--help参数就能看到。下面是我实测的结果。当然,如果对GEMM做极致调优,或许还能再挤出一点点性能,但咱们这个方法图的就是个方便快捷——你甚至在提货现场花个10分钟就能跑一轮验验货。从下面的数据也能看出来,CUTLASS profiler内置的GEMM算子已经把运算单元的理论峰值性能榨到了八九成,完全够用了。

实验结果

注:以下表中的“利用率”可不是nvidia-smi里那个GPU-Util(那个指标除了让你知道GPU在跑以外,基本没什么参考价值)。这里的“利用率”,指的是某种精度的GEMM算子在运算过程中,对GPU对应精度的运算单元硬件的实际利用效率。
  • H100 PCIe vs. A100 PCIe (CUTLASS 3.5.1 GEMM算子)


    H100与A100算力对比数据

注:单位均为TFLOPS(浮点)或TOPS(整型),数值均为实际性能,而非稀疏等价性能。后缀为T的行表示使用Tensor Core。

从数据可以看出来,CUTLASS目前对A100的优化确实比对H100 PCIe要更到位。H100 PCIe的价格是A100 PCIe的两倍,功耗高出1.4倍,差不多换来了2倍的算力(同时内存和通信带宽也略有提升)。不过,它的INT4性能被阉割了,但增加了FP8的支持。可以做个判断:H100 PCIe版的能耗比和性价比,其实有点尴尬。与其买一两块H100 PCIe尝鲜,不如一步到位,多花点钱上8卡或4卡的H100 SXM整机。正所谓“买的越多,省的越多”。

  • 4090 vs. A10(CUTLASS 3.5.1 GEMM算子)


    4090与A10算力对比数据

再看4090和A10的对比。CUTLASS对4090各种精度的优化都挺不错,但对A10的FP32和FP64优化就有点力不从心了。作为一款常用的大模型推理卡,A10和4090在显存和通信的规格上其实比较接近,价格也差不多。但A10的计算性能只有4090的三分之一,唯一能拿得出手的优势就是功耗也是4090的三分之一——少交点电费总归是好事。

实验设置

19b4c5e065e7e5bbc8082dfc7dbd792bdac850fc
  • 4090测试时的CUTLASS编译选项

-DCUTLASS_NVCC_ARCHS="89"
  • A10测试时的CUTLASS编译选项

-DCUTLASS_NVCC_ARCHS="86"
  • A100测试时的CUTLASS编译选项

-DCUTLASS_NVCC_ARCHS="80"
  • H100测试时的CUTLASS编译选项

-DCUTLASS_NVCC_ARCHS="90a"