首页 > 教程攻略 > ai资讯 >苹果开源OpenELM,大模型开源领域再迎一巨头!

苹果开源OpenELM,大模型开源领域再迎一巨头!

来源:互联网 时间:2026-08-03 12:43:11

4月24日,苹果悄悄开源了大语言模型OpenELM。这步棋走得很有意思——就在微软刚刚放出Phi-3 Mini之后,苹果也拿出了面向移动设备的模型方案。

苹果开源OpenELM,大模型开源领域再迎一巨头!

OpenELM提供了指令微调和预训练两种版本,参数规模覆盖2.7亿、4.5亿、11亿和30亿档位,支持文本生成、代码编写、翻译、摘要等常见任务。别看最小的只有2.7亿参数,苹果却用1.8万亿tokens的数据做了预训练——这恰恰是它小身材能打出好成绩的关键。

更值得关注的是,苹果把训练OpenELM的深度神经网络库CoreNet也一并公开了。不到两天时间,GitHub上的Star就已经超过1100颗。苹果此前的一些知名研究,比如MobileOne、CVNets、MobileViT、FastVit,都是基于CoreNet完成的。

目前大模型领域,开源和闭源两派泾渭分明。闭源阵营有OpenAI、Anthropic、谷歌、Midjourney、百度、科大讯飞等;开源这边则是Meta、微软、谷歌、百川智能、阿里巴巴、零一万物等。苹果作为手机闭源生态的霸主,这次罕见地加入开源阵营,很可能是在效仿谷歌的策略——先用开源拉拢开发者,再用闭源产品实现商业化。

不管动机如何,苹果选择开源对开发者和中小企业来说确实是件好事。与以往只给模型权重和推理代码的做法不同,这次苹果把完整的训练、评估框架都拿了出来,包括数据准备、模型训练、微调和评估流程,还附带了多个预训练检查点和训练日志。这意味着我们可以直接拆解全球顶级科技公司的技术思路和工程实践。

OpenELM架构:小而精的设计思路

OpenELM采用了无编码器的Transformer架构,并在几个关键点上做了创新。最核心的是它的“层级缩放”策略——让模型在不同Transformer层之间更高效地分配参数,用更少的训练数据就能取得更好的性能,同时准确率提升明显。

举个例子:11亿参数的OpenELM,准确率比12亿参数的OLMo模型高出2.36%,而预训练数据量只有后者的一半。这个对比相当能说明问题。

在具体实现上,OpenELM去掉了全连接层中的可学习偏置参数,使用RMSNorm做预归一化,用旋转位置嵌入编码位置信息。注意力机制方面,用分组查询注意力替代了多头注意力,前馈网络换成了SwiGLU FFN,还引入了Flash注意力来加速缩放点积注意力的计算。这些改动加在一起,让模型能在更少的资源下完成训练和推理。

训练流程与数据集:扎实的工程落地

训练框架用的是CoreNet,优化算法是Adam,总共进行了35万次迭代。参数更新采用小批量随机梯度下降,批量大小为4096,并设置了合适的学习率和权重衰减。

预训练数据方面,OpenELM使用了RefinedWeb、去重后的PILE、RedPajama的子集以及Dolma v1.6的子集——这些公开数据加起来大约1.8万亿tokens。苹果还采用了动态分词和数据过滤方法,实现了实时过滤和分词,简化了实验流程。分词器则和Meta的Llama保持一致,确保实验的可比性。

这次苹果确实是“一开到底”,从模型到框架到训练细节全部公开。家大业大就是敢玩,这也透露出苹果进军大模型领域的决心。可以预见,开源社区接下来会更热闹了。