Llama 3.1 405B 中文基准评测出炉!推理总分80.44,略超GPT-4 Turbo,不敌GPT-4o
来源:互联网
时间:2026-08-19 14:18:10
7月23日,Meta正式发布了
Llama 3.1 405B
GPT-4、GPT-4o、Claude 3.5 Sonnet
不过,中文社区最关心的是:这模型在中文场景下到底行不行?我们决定亲自下场,针对中文推理相关的核心任务做了一轮深度测评。具体来说,用了两套自建的基准:一套是中文数学多步推理基准(
SuperCLUE-Math6
SuperCLUE-Code3
先说结论
结论1:在SuperCLUE推理任务的总分上,Llama 3.1 405B拿到
88.44分
结论2:数学专项方面,模型在SC-Math6上得分
91.19分
结论3:代码专项方面,SC-Code3得分
69.68分
测评结果
SuperCLUE-Math6
SuperCLUE-Code3
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名