实测:本地跑llama3:70B需要什么配置
Llama 3 70B刚刚发布的时候,不少人的第一反应是:又一个“开源最强”来了。但看完测试结果,这个结论还真不是随便说说。直接结果是什么?Llama 3 70B在多项基准测试中,已经能和Claude 3 Sonnet、Gemini 1.5 Pro掰手腕,甚至在部分维度上超过了去年发布的那两款GPT-4。这意味着什么?Llama 3已经稳稳站到了当前开源大模型的顶流位置,而且这不是空话,有排名为证。

看看这份LLM排行榜,你就明白了。

更让人兴奋的是,强大的模型不再是云端大厂的专属特权。现在,每个人都可以在本地跑起Llama 3。无论是轻量级的8B版本,还是性能更强的70B版本,用户完全可以根据自己的硬件条件来选择。当然,70B版本对本地资源的要求确实不低,但也不是遥不可及。
这对“白嫖党”来说,简直是一波巨大的福利。回想一下,以前想在本地跑个GPT-4级别的模型几乎是天方夜谭——庞大的计算资源和专业设备摆在那里,普通人根本摸不着。但现在,Llama 3让个人用户也能在自己的设备上玩转这些强大模型,做各种实验和研究,门槛被实实在在拉低了一大截。
实测下来,Llama 3 8B版本在大多数普通配置的个人PC上都能跑起来。哪怕没有显卡,只要CPU不是太拉胯,运行起来也还算能凑合用。今天这篇文章的重点,是来测一测本地PC跑70B模型到底需要多少资源。
先用Ollama把70B模型下载下来。如果还不知道Ollama是什么,可以自行搜索了解一下。这里有个小细节需要注意——Ollama默认缓存目录在C盘当前用户目录下,几个大模型一下来,C盘分分钟被撑爆。所以,务必修改环境变量
OLLAMA_MODELS
打开命令行,运行这条指令:
ollama run llama3:70b

几分钟后下载完成,出现>>>提示符,就可以跟70B模型愉快地聊天了。
下面放两张图,对比模型加载前后系统硬件占用的情况:
模型加载前:

模型加载后:

从数据上看,24GB显存加上64GB内存,就能让70B模型跑起来。这个配置对普通办公和家用电脑确实有点门槛,但已经不算高不可攀了。
先打个招呼试试:

接下来测试几个基础问题:

从测试结果来看,看来还不能完全信它。不过值得表扬的是,70B模型不乱飙英文。相比之下,8B模型虽然更轻量、速度更快,但中文表现确实一言难尽。

再来看一个实际场景。虽然我提的需求只是写一段简单代码,但第一时间想到的是直接调用Nmap。如果他真的自己从头到尾啪啦啪啦写一大段,即使能实现需求,也会显得有点“傻”。懂得调用现成的工具,看起来反而没那么笨,这才是更聪明的做法。

综合来看,70B模型作为本地化Agent的底座模型,真的是再合适不过了。性价比王者,当之无愧。接下来,好玩的事情会变得越来越多。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名