一大堆Llama3.1-Chinese正在袭来
写在前面
Llama3.1模型开源还不到一周,社区里就已经冒出好几个做中文增强的仓库了——这速度,确实够卷的。
原因也不难理解:Meta这次虽然标榜多语言,但官方重点其实只覆盖了英语、法语、德语、印地语、意大利语、葡萄牙语、西班牙语和泰语,中文基本是“顺带”的。用Llama3.1问中文问题,它确实能回答,但经常中英文混着来,而且词表里根本没中文token,中文场景下的解码效率自然就低了。
不过话说回来,这反倒给中文大模型留下了空间,也让开源社区多了不少活干。
要对Llama3.1做中文增强,常规路线还是那三板斧:扩充中文词表、用中文数据做continue-pretrain、再搞中文SFT。下面先快速过一遍Llama3.1的基本情况和效果,然后盘点几个已经开源的中文增强项目。
Llama3.1介绍和效果
关于Llama3.1的详细介绍已经铺天盖地了,这里不再重复。之前写过两篇专门的文章,感兴趣的可以翻翻。现在很多平台都支持直接体验,如果本地没资源部署,Hugging Chat是个不错的入口。
虽然Llama3.1-405B在榜单上表现亮眼,但一碰到“9.9和9.11谁大”这种问题,照样能一本正经地胡说八道。
问题出在Tokenizer上——之前不少模型都强调过,数字应该按单个数字切分,但Llama3.1没这么干,挺让人费解的。
其实GPT-4也一样会翻车。
拿几个“弱智吧”级别的题目考考405B版本:
- 石油也是油,为啥没人用它来炒菜?
- 如果把脏话都说出来了,那么嘴是不是就干净了
- 为什么孙悟空是中国猴子却叫美猴王,不应该叫中猴王吗
- 下雨天关节疼,那我骗它是晴天不就不会疼了
整体来看,它对语义的理解还算到位,但如果不刻意指定用中文回答,输出就经常中英混杂。
客观说,如果是公开的简单中文任务,Llama3.1可以直接用;但到了专业领域或具体场景,效果可能就不太行了。自己在一个中文分类任务上对比过Qwen2-7B、ChatGLM3-6B和Llama3.1-8B,无论有没有SFT,Llama3.1-8B的中文效果都明显落后于另外两个。
当然,这只是个人实验结果,不是定论,欢迎有类似经验的朋友一起讨论。
Chinese-Llama3.1模型
下面列几个已经开源权重的中文增强版本——才两天时间,后面肯定还有更多,有些仓库甚至还在“占坑”阶段。
- shenzhi-wang/Llama3.1-8B-Chinese-Chat
- shenzhi-wang/Llama3.1-70B-Chinese-Chat
- haijian06/Llama3.1-Chinese-Chat
- shareAI/llama3.1-8b-instruct-dpo-zh
目前基本还是以SFT为主,再等一段时间,Chinese-Llama3.1系列会越来越多——毕竟之前Chinese-Llama3已经积累了不少经验。
写在最后
Llama3.1的开源意义确实不小——405B证明了开源模型也能追上闭源的水平。虽然Mistral新开的123B模型直接狙击了它,但整体而言,开源生态越来越好了。
从实际落地角度看,8B和70B的模型作用更直接。毕竟很多大模型上线的规模也就8B,再大的并发推理根本扛不住。
有个不太成熟的想法:大模型平台厂商可能更欢迎超大开源模型——他们有自己的infra优化机制,专注推理、有卡,可以为更多企业服务。而小模型才是企业自己玩得转的:服务器不用堆太多,开源推理框架就够了。
最后,小扎的格局得再打开些——Mistral-123B已经支持中文了哦。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名