阿里开源的32B大模型到底强在哪里?
阿里巴巴最近开源了一个320亿参数的大语言模型Qwen1.5-32B,网上都说很强很强,那么它到底强在哪里呢?
更高的性价比
Qwen1.5-32B中的B是billion,也就是10亿,32B就是320亿参数量。阿里之前还开源过Qwen-1.5-72B,720亿参数。相比之下,新模型参数少了一半多,可实际测试成绩却几乎没掉队。
大语言模型文件里主要就是参数。参数少一半,文件大小也小一半,加载到显存时占用的空间自然也跟着减半。现在显卡有多紧俏?消费级的3090大概要8K,4090已经飙到1.5个W了。显存占用少一半,意味着可以用更少、更低显存的显卡,成本直接降下来,但模型表现和之前的大块头差别不大——这才是真正的性价比。
性能测试优良
上面说测试表现不错,那么到底体现在哪?拿下面这张测试结果图表来说:

很多人看这类图表时比较懵,主要就看谁的分数高。这里把几个关键指标的含义拆解一下:
- (Massive Multitask Language Understanding):多领域知识理解,考的是综合能力。涵盖57个不同领域的选择题,包括历史、文学、科学、工程技术等,用来评估模型的泛化能力——解决没训练过的新问题。
MMLU
- :中文场景的多领域知识理解,由MBZUAI、上海交通大学、微软亚洲研究院推出。67个主题,涉及自然科学、社会科学、工程、人文及常识,专门评估模型在中文语境下的知识和推理能力。
CMMLU
- :中文能力评估。上海交通大学、清华大学和爱丁堡大学联合推出,包含13948道多选题,覆盖52个学科和四个难度级别。
C-Eval
- :数学问题解决能力。Google开发的数学题集,约8000个高中到大学水平的数学问题。
GSM8K
- :类似GSM8K,涵盖初等代数、数论、概率、几何、微积分等多个领域,题目用LaTeX格式编写。
MATH
- :数学推理和问题解决能力,需要模型生成数学表达式或文字解答。
MBPP
- :编程能力。OpenAI创建,包含数百个编程题目及其解决方案。
HumanEval
- (Big-Bench Hard):复杂语言理解能力。Google、斯坦福等开发的数据集,包含需要深度推理、常识运用或复杂认知任务。
BBH
看懂这些指标后,再看图表:Qwen1.5-32B和Qwen1.5-72B的能力确实相差无几,在复杂语言理解(BBH)上甚至略胜一筹——不知道是不是学习了百度弱智吧的问题。
图表里还有几个模型值得关注:
- :Meta(Facebook)开源的大模型,可以说国内大模型的百花齐放离不开Llama。但从图表看,这个模型已经落后了,真的是青出于蓝而胜于蓝。
Llama2-34B
- :零一万物(李开复老师投资)开发的开源模型,300多亿参数,综合能力不错,但数学和解决复杂问题的能力比Qwen差一点。
Yi-34B
- :欧洲公司开发的稀疏专家混合模型。内部有多个子模型,比如有的擅长数学,有的擅长法语,有的擅长代码。生成Token时会选择两个专家子模型(每个6B参数),所以比普通300亿参数模型处理更快。从图表看,它在数学和编程方面的能力挺出色。
Mixtral-8x7B
很多人关心国内大模型和GPT的差距。这里有一张Qwen1.5-72B和GPT-4的能力对比图:

差距还是很明显的,数学、编程、复杂问题处理等方面都有很大的提升空间。当然我们一直在追赶,只是别人也在进步。有人说这个差距是1年,也有人说是2年,你怎么看?
实测体验
指标不能代表全部。用最近热议的“弱智吧”问题来测一测——弱智吧是百度贴吧,充满荒谬离奇的发言,研究者发现用这里的问题训练模型能提升逻辑能力。
测试使用云服务器上部署的镜像实例,基于开源项目text-generation webui。启动后进入聊天页面,先设置角色为“AI助理”,模式选“chat-instruct”。然后和它聊了三个经典的弱智吧问题。结果只有“生鱼片是死鱼片”这个问题回答得不太好——大模型好像不太理解“生”和“死”在这个语境里的区别。
正常应该怎么回答?到阿里的“通义千问”上问了一下,感觉也没太说到点子上,毕竟师出同门,语料差不多。又找了一个GPT-4的应用问了一下。GPT-4倒是准确把握住了“生”和“死”的含义,只是回答得没那么直接。
在测试数据集评测中,Qwen1.5-32B的中文处理能力明显高于GPT-4,但“生鱼片是死鱼片”这个问题确实没答好。这是模型泛化能力不足,还是训练语料的问题呢?你怎么看?
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名