智慧与“长文本”并存,360 开源最长模型,吊打“弱智吧”!
之前红衣大叔在公开课上聊了2024年AI产业的16个趋势,当时就透了个底——要开源。这不,兑现承诺了,360直接把7B系列大模型开源了。
现在市面上大模型多到让人眼花,同质化严重,大家多少有点审美疲劳。但说实话,
360这次开源的这个,确实不太一样

一口气开源了四个模型:基础模型,以及4K、32K、360K三种上下文长度的版本。
其中
基础模型
3.4万亿Tokens的高质量语料库训练
光看分数不过瘾,到底实际能力如何?老规矩,拉出来遛遛。我们在魔搭(也就是国产版的Huggingface)上部署测试了一下这个7B模型,直接挑战“弱智吧”问题集——那可是人类智慧与逻辑陷阱的集大成者。
怕有朋友不太了解“弱智吧”,简单说,它是百度贴吧里一个很火的小组,里面的问题看似脑残,实则双关、逻辑梗、哲学陷阱样样俱全。先来测测双关语,看看模型的
思维灵活度
第一回合:大家都说我嘴很甜,他们什么时候尝的?
第二回合:孙子是怎么提前两千年预判战斗机的发明的,还提出了“战机很重要”“不要失去战机”这种理论的?
第三回合:弱碱是碱,那么弱智是智吗?
三连全对,有点意思。再来点棘手的逻辑题,测测模型的
哲学思辨能力
第四回合:为什么近视的是眼睛,看不清的是未来?
第五回合:完美的人会不会因为缺少缺点而变得不完美?
第六回合:为什么等红灯是在等绿灯?
直接“出院”吧。连“弱智吧”这种睿智提问都能应付自如,常识、数学、编程之类的问题更不在话下。有兴趣的朋友可以亲自去体验。
除了基础能力扎实,360的对话模型还开放了4K、32K、360K三种文本长度。
据了解,360K(约50万字)是目前国产开源模型里上下文最长的
)
所谓“上下文长度”,可以理解成大模型的视野范围。视野越长,模型回答问题能看到的信息就越全面,答案准确度自然更高。隔壁长文本标杆Kimi,内测的200万字长文本功能,不少朋友等得脖子都长了,也没见几个人拿到资格。反观红衣大叔,格局确实大,一开源就给了个国内最长的。
更重要的是,360K这个模型在
中英文大海捞针测试
准确率都超过了98%
我们顺手喂了《三体》第一部和第二部的全文,来测试长文本能力。问“四位面壁者和他们的破壁人分别是谁?”回答准确无误;问“庄颜最喜欢的画里写了什么字?”回答:“亲爱的,我们在末日等你。”——连这种细节都能精准提取。老板让我写的调研报告,这下有指望了。
为什么能做到这么牛?关键在于技术路线:360没有采用滑动窗口Attention、跳跃Attention这类有损压缩方案,而是选择了
超长文本的无损压缩技术
两阶段训练
这种方式有效平衡了训练长度和训练效率,实现了高效的长文本拓展。
总的来说,360这次开源的7B大模型,连同微调训练代码、推理代码等全套工具集,开箱即用,在7B参数量级上,确实算得上“遥遥领先”了。另外听说360自己把这个开源模型和网红AI浏览器打包,马上要推出端侧版本——断网也能用,千元显卡就能跑起来,对创业者来说是个福音。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名