Llama3中文基准测评出炉!性能惊艳,数学、代码能力接近GPT4
本测评结果仅用于学术研究。
4月17日,Meta带着8B和70B参数的Llama3模型正式亮相,全球科技圈直接炸了锅。官方数据很唬人:在定制的24K GPU集群上,用超过15T token的数据训练,代码量直接翻倍(比Llama2多4倍),上下文窗口也翻了一倍到8K。Meta声称,这是迄今为止最强大的Llama系列,在多个关键基准测试中碾压同类——那么,中文场景下呢?数学题能不能算明白?代码写得好不好?跟国内外头部模型比起来到底什么水平?

我们直接拿SuperCLUE-Math6(中文数学多步推理,2024道题)和SuperCLUE-Code3(中文代码生成,195道题,1560个测试用例)把Llama3-70B拉出来遛了一圈。模型用的是POE版,配置参考官方文档,prompt统一加了“You must answer in Chinese.”,确保输出中文。先给结论,再细拆。
先说结论
结论1:
结论2:
结论3:
结论4:
测评分析
1 定量分析
SuperCLUE-Code3
代码方面,Llama3-70B整体得分62.57,略低于GPT-4。低难度题跟GPT-4相当,中难度题略弱,但高难度题反而超了一点点。如果换成HumanEval(英文经典基准)来比,结果也类似——整体略低GPT-4,但高难度有惊喜。
SuperCLUE-Math6
数学方面,Llama3-70B得分83.77,推理等级评定为5级(满分5级)。比GPT-4低4.63分,比文心一言4.0和GLM-4也稍弱。把推理步数拆开看:1-3步跟GPT-4 Turbo、Claude3-Opus差距微弱,但4-5步就明显掉队了。
SC-Math6 vs GSM8K
如果换成GSM8K(英文数学基准),Llama3-70B的表现跟SC-Math6上的趋势一致:基础推理稳,复杂推理有优化空间。
小结
2 定性分析
通过几个典型例子,看看Llama3-70B的实际表现(建议在电脑端查看,体验更好)。
SC-Math6示例
较好的示例1
问1:
解题过程:
小张制作了5个陶艺杯子,每个杯子需要使用陶土500克和釉料50克。所以,小张总共使用了陶土5 x 500克 = 2500克和釉料5 x 50克 = 250克。
学校原本有陶土10千克,釉料1千克。小张使用之后,学校剩余陶土为10千克 - 2500克 = 7500克。
最终答案:【7500】
追问:
解题过程:
小张已经使用了陶土2500克和釉料250克。现在还有50名学生,每个人需要制作2个同样的杯子,每个杯子需要使用陶土500克和釉料50克。所以,50名学生总共需要使用陶土50 x 2 x 500克 = 50000克和釉料50 x 2 x 50克 = 5000克。
学校原本有陶土10千克,釉料1千克。小张使用之后,学校剩余陶土为7500克,釉料为750克(1000 - 250)。为了满足全班需求,学校还需要准备陶土为50000克 - 7500克 = 42500克,釉料为5000克 - 750克 = 4250克。
由于问题要求答案是千克单位,所以学校还需要准备陶土为42500克 / 1000 = 42.5千克 ≈ 43千克,釉料为4250克 / 1000 = 4.25千克 ≈ 4千克。
最终答案:【陶土43千克,釉料4千克】
较好的示例2
问1:
解题过程:
总共有300个手工艺品,分配到60个摊位,每个摊位:300 ÷ 60 = 5.00。最终答案:【5】
追问:
解题过程:10 × 60 = 600。最终答案:【600】
可改进的示例1
问1:
解题过程:
设每个小组的人数为x,4x = 36 → x = 9。那么小组数为36 ÷ 9 = 4。最终答案:【4】
追问:
同样的逻辑:4x = 40 → x = 10,小组数40 ÷ 10 = 4。最终答案:【4】
这个模型在题目理解上出现了偏差——问的是“四人小组”,但模型反而先求每组人数再除,绕了一个弯。虽然答案对了,但过程不合常理。
可改进的示例2
问1:
解题过程:
第一天8000,第二天9000……第七天14000。总和 = 8000+9000+10000+11000+12000+13000+14000 = 81900。最终答案:【81900】
追问:
第一周最后一天14000,减500得13500。最终答案:【13500】
这个例子中,模型计算没问题,但回答过于机械——人家问的是“第二周第一天”,它直接给出了正确答案,但缺少实际思维过程的解释。
SC-Code3示例
示例:
题目:从给定的二维表格中找出年度得分最高的员工姓名和总得分。第一列为姓名,后续各列为季度得分。返回一个元组,包含姓名和总得分。如果最高分并列,返回名字字典序最小的。没有则返回(-1, -1)。
测试用例:
find_best_employee([ ["张伟", 86, 92, 85, 88], ["王芳", 90, 91, 92, 87], ["李娜", 88, 89, 93, 95], ["刘洋", 85, 87, 86, 90] ])
预期输出:("李娜", 365)
Llama3-70B给出了正确代码和结果,逻辑清晰,没有多余输出。
小结
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名