首页 > 教程攻略 > ai资讯 >大模型参数量都是7B,13B和65B等背后的原因是什么?

大模型参数量都是7B,13B和65B等背后的原因是什么?

来源:互联网 时间:2026-08-02 20:37:06

最直接的原因就是历史传承。当初OpenAI做

GPT-3

时,就是用这几个参数规模立下了标杆。随后Meta推出LLaMA,直接借鉴了GPT-3的经验,发布了7B、13B、33B、65B四个尺寸。由于LLaMA在开源领域的号召力,后来者为了生态兼容性,基本都沿用了这套数值,久而久之就成了行业惯例。

第二个原因是适配推理设备。尤其是小参数模型,得能塞进不同级别的GPU显存里。常见的显存从4GB到80GB不等,显存占用遵循一个简单公式:

模型空间大小 = 参数量 × 参数精度

大模型参数量都是7B,13B和65B等背后的原因是什么?

这样一来,就能方便地在单卡上部署推理,降低使用门槛。比如ChatGLM2-6B,62亿参数,权重文件用BF16精度存储,实际显存占用大约12.5GB,一张英伟达T4显卡(16GB)就能跑起来,门槛一下就降下来了。

第三点要从模型结构设计说起。当前大模型几乎都采用Transformer的decoder-only结构(未遮盖部分),参数量受到隐藏层维度、层数、注意力头数等多个因素影响。而这些参数取值既参考了GPT-3,又结合了实际硬件性能进行调优。下面是LLaMA系列和GPT系列模型参数量的统计对照:

实际参数量P

隐藏层维度d_model

层数N

注意力头数h

估算参数量

6.7B

4096

32

32

6590300160

13.0B

5120

40

40

12730761216

32.5B

6656

60

52

32045531136

65.2B

8192

80

64

64572358656

(注:上表为LLaMA系列数据)

最后一个原因,是性能、成本与训练时间的综合平衡。训练时间可以按以下公式估算:

训练时间 = 6TP / (n × X × u)

其中X是计算显卡的峰值FLOPS,n为显卡数量,u为利用率。以LLaMA-65B为例,在2048张80GB显存的A100上,用1.4TB tokens的数据训练65B参数的模型。每张A100的峰值性能为624TFLOPS,假设GPU利用率为0.3,代入公式就能算出所需时间。这种规模恰好能在现有硬件条件下,用合理的成本和时间内完成训练——不浪费算力,也不让显存空转。久而久之,7B、13B、65B就变成了最实用的“黄金尺寸”。