首页 > 教程攻略 > ai资讯 >Llama3中文基准测评出炉!性能惊艳,数学、代码能力接近GPT4

Llama3中文基准测评出炉!性能惊艳,数学、代码能力接近GPT4

来源:互联网 时间:2026-08-02 12:56:24

本测评结果仅用于学术研究。

4月17日,Meta带着8B和70B参数的Llama3模型正式亮相,全球科技圈直接炸了锅。官方数据很唬人:在定制的24K GPU集群上,用超过15T token的数据训练,代码量直接翻倍(比Llama2多4倍),上下文窗口也翻了一倍到8K。Meta声称,这是迄今为止最强大的Llama系列,在多个关键基准测试中碾压同类——那么,中文场景下呢?数学题能不能算明白?代码写得好不好?跟国内外头部模型比起来到底什么水平?

我们直接拿SuperCLUE-Math6(中文数学多步推理,2024道题)和SuperCLUE-Code3(中文代码生成,195道题,1560个测试用例)把Llama3-70B拉出来遛了一圈。模型用的是POE版,配置参考官方文档,prompt统一加了“You must answer in Chinese.”,确保输出中文。先给结论,再细拆。

先说结论

结论1:

Llama3在中文逻辑推理任务(小学数学推理、初中级代码)上表现相当能打。虽然没有超过GPT-4,但差距不大(-2.9),不过跟GPT-4 Turbo之间还有+-6.18分的距离。

结论2:

在SC-Code3中文代码基准上,Llama3-70B拿了62.57分,跟GPT-4接近,离GPT-4 Turbo还差一截。有意思的是,在高级难度代码任务上,它反而比GPT-4表现好一点点。

结论3:

在SC-Math6中文数学推理上,Llama3-70B得分83.77,不敌GPT-4、Claude3-Opus和GPT-4 Turbo。细看推理步数:1-3步跟GPT-4 Turbo几乎平手,但4-5步的复杂推理差距就拉开了。

结论4:

跟国内头部闭源模型比,Llama3-70B的中文数学能力相差无几——只比文心一言4.0低1.83分。这就不算丢人了。

测评分析

1 定量分析

SuperCLUE-Code3

代码方面,Llama3-70B整体得分62.57,略低于GPT-4。低难度题跟GPT-4相当,中难度题略弱,但高难度题反而超了一点点。如果换成HumanEval(英文经典基准)来比,结果也类似——整体略低GPT-4,但高难度有惊喜。

SuperCLUE-Math6

数学方面,Llama3-70B得分83.77,推理等级评定为5级(满分5级)。比GPT-4低4.63分,比文心一言4.0和GLM-4也稍弱。把推理步数拆开看:1-3步跟GPT-4 Turbo、Claude3-Opus差距微弱,但4-5步就明显掉队了。

SC-Math6 vs GSM8K

如果换成GSM8K(英文数学基准),Llama3-70B的表现跟SC-Math6上的趋势一致:基础推理稳,复杂推理有优化空间。

小结

:从定量数据看,Llama3-70B的代码能力略低于GPT-4,中文数学的基础推理跟顶尖模型差距不大,但长链条推理还需要继续打磨。

2 定性分析

通过几个典型例子,看看Llama3-70B的实际表现(建议在电脑端查看,体验更好)。

SC-Math6示例

较好的示例1

问1:

在学校的手工艺课上,小张制作了5个陶艺杯子,每个杯子需要使用陶土500克和釉料50克。假设学校已有陶土总共有10千克,釉料共1千克,那么小张使用之后,学校剩余多少克陶土?

解题过程:

小张制作了5个陶艺杯子,每个杯子需要使用陶土500克和釉料50克。所以,小张总共使用了陶土5 x 500克 = 2500克和釉料5 x 50克 = 250克。

学校原本有陶土10千克,釉料1千克。小张使用之后,学校剩余陶土为10千克 - 2500克 = 7500克。

最终答案:【7500】

追问:

如果除了小张以外,有50名学生每个人需要制作2个同样的杯子,那么学校还需要准备多少千克的材料才能满足全班需求?

解题过程:

小张已经使用了陶土2500克和釉料250克。现在还有50名学生,每个人需要制作2个同样的杯子,每个杯子需要使用陶土500克和釉料50克。所以,50名学生总共需要使用陶土50 x 2 x 500克 = 50000克和釉料50 x 2 x 50克 = 5000克。

学校原本有陶土10千克,釉料1千克。小张使用之后,学校剩余陶土为7500克,釉料为750克(1000 - 250)。为了满足全班需求,学校还需要准备陶土为50000克 - 7500克 = 42500克,釉料为5000克 - 750克 = 4250克。

由于问题要求答案是千克单位,所以学校还需要准备陶土为42500克 / 1000 = 42.5千克 ≈ 43千克,釉料为4250克 / 1000 = 4.25千克 ≈ 4千克。

最终答案:【陶土43千克,釉料4千克】

较好的示例2

问1:

在一次古镇文化节上,主办方准备了300个用于展示的传统手工艺品。如果有60个摊位,每个摊位都要平均分配这些手工艺品,请问每个摊位能分配到多少个?

解题过程:

总共有300个手工艺品,分配到60个摊位,每个摊位:300 ÷ 60 = 5.00。最终答案:【5】

追问:

如果每个摊位展示的手工艺品都能吸引10人停下参观,那么整个文化节预计能吸引多少人?

解题过程:10 × 60 = 600。最终答案:【600】

可改进的示例1

问1:

为庆祝儿童节,小明的班级组织了一项知识竞赛,比赛中学生要分成四人小组进行。如果班里有36名学生,并且每个小组必须人数相同,一共可以分成几个小组?

解题过程:

设每个小组的人数为x,4x = 36 → x = 9。那么小组数为36 ÷ 9 = 4。最终答案:【4】

追问:

如果班里有40名学生,并且每个小组必须四人一组,可以分几个小组?

同样的逻辑:4x = 40 → x = 10,小组数40 ÷ 10 = 4。最终答案:【4】

这个模型在题目理解上出现了偏差——问的是“四人小组”,但模型反而先求每组人数再除,绕了一个弯。虽然答案对了,但过程不合常理。

可改进的示例2

问1:

小明每天计划通过走步来锻炼,第一天走8000步,之后每天比前一天多走1000步。连续走7天,请问一共走了多少步?

解题过程:

第一天8000,第二天9000……第七天14000。总和 = 8000+9000+10000+11000+12000+13000+14000 = 81900。最终答案:【81900】

追问:

接下来的第二周,小明决定每天少走500步。那么第二周的第一天走了多少步?

第一周最后一天14000,减500得13500。最终答案:【13500】

这个例子中,模型计算没问题,但回答过于机械——人家问的是“第二周第一天”,它直接给出了正确答案,但缺少实际思维过程的解释。

SC-Code3示例

示例:

题目:从给定的二维表格中找出年度得分最高的员工姓名和总得分。第一列为姓名,后续各列为季度得分。返回一个元组,包含姓名和总得分。如果最高分并列,返回名字字典序最小的。没有则返回(-1, -1)。

测试用例:

find_best_employee([ ["张伟", 86, 92, 85, 88], ["王芳", 90, 91, 92, 87], ["李娜", 88, 89, 93, 95], ["刘洋", 85, 87, 86, 90] ])

预期输出:("李娜", 365)

Llama3-70B给出了正确代码和结果,逻辑清晰,没有多余输出。

小结

:从定性示例看,Llama3-70B解题步骤完整,准确性总体较高,但在部分题目中会出现理解偏差或过程冗余,后续版本可以进一步优化稳定性和推理效率。