首页 > 教程攻略 > ai资讯 >OpenCSG发布csg-wukong-1B模型 打造人人可负担的自研预训练模型

OpenCSG发布csg-wukong-1B模型 打造人人可负担的自研预训练模型

来源:互联网 时间:2026-08-02 13:15:09

大模型领域的“军备竞赛”还在继续,但一个有趣的现象是,当大家都在追逐百亿、千亿参数的大模型时,一批小而美的“轻量级选手”正在悄然崛起。它们不需要昂贵的算力堆砌,却能解决特定场景下的实际问题。今天要聊的,就是这样一个典型代表——OpenCSG团队推出的csg-wukong-1B模型。

01 关于csg-wukong模型

OpenCSG发布csg-wukong-1B模型  打造人人可负担的自研预训练模型

csg-wukong是OpenCSG算法团队自研的预训练模型系列,其中base模型csg-wukong-1B定位于轻量化,参数量只有1B,属于典型的小语言模型(SLM)。别看它“个头小”,优点却相当硬核:参数量小意味着推理成本低,性能上又足够强悍,可以灵活适配多种应用场景,下游微调任务也能轻松驾驭。

在预训练阶段,csg-wukong-1B走的是“两步走”路线。第一阶段使用了1T tokens(3个epoch)的英文通用语料,涵盖the pile、wikipedia、Commoncrawl、C4、StackExchange、Github、arxiv等主流数据集。第二阶段则引入了30B tokens的合成数据——这些数据可不是随便生成的,而是通过gpt4、mixtral 8X7B、QWEN-72B综合蒸馏得到的高质量训练数据,经过精心配比完成第二阶段的训练。

整个预训练过程在16张H800卡上持续了43天。坦白说,这个资源消耗量对于不少研究团队、企业甚至高校而言,都是完全可以接受的。更重要的是,模型仅有1B参数量,部署成本极低,个人PC、手机乃至各类IoT边端设备都能跑起来——这才是一个真正“人人都能负担得起”的模型。

csg-wukong-1B模型下载与体验地址:

传神社区下载:https://opencsg.com/models/OpenCSG/csg-wukong-1B

传神社区模型在线体验:https://opencsg.com/spaces/OpenCSG/csg-wukong-1B

Huggingface社区:https://huggingface.co/opencsg/csg-wukong-1B

值得一提的是,csg-wukong-1B在开源不到一周的时间里,Huggingface社区的模型下载量就直逼1K,这个反响相当不错。

接下来,我们就从训练框架的选择与魔改、训练方法的优化、数据质量评估方法以及模型评测结果等多个维度,来详细拆解csg-wukong的“修炼之路”。

02 高效的训练框架

在训练框架的选型上,OpenCSG团队选择了近期炙手可热的pytorch-lightning框架。相比于deepspeed、megatron这类重量级框架,lightning明显更轻量。训练小参数量模型时,直接采用数据并行方法——比如FSDP——就能获得极佳的训练速度,通信开销也相对更小。更重要的是,它已经融入到Nvidia Nemo框架中,拓展性很好。

不仅如此,团队还对lightning框架进行了一番“魔改”。在训练正式启动之前,系统会对数据量、显存、数据长度进行综合评估,自动配置出当前硬件环境下最合适的分词数据块。这样做的好处是,能够有效避免像Huggingface tokenize API那样容易引发的显存分布不均和显存碎片问题。

lightning助力csg-wukong

批数据分词后显存占用均匀

预训练过程中,对GPU服务器的监控以及框架的稳定性至关重要。团队采用了wandb对lightning框架的训练过程进行全方位监控——无论是GPU显存占用、GPU功耗,还是CPU、内存以及磁盘状态,都可以实时掌握。

值得注意的是,loss和ppl(困惑度)这些指标在训练前期还能满足分析需求,一旦曲线趋于平坦,就必须引入更灵敏的监控工具。由于早期lightning版本没有集成lm-evaluation-harness,团队手动魔改了评测监控功能,这样就能清晰看出:训练到哪一部分数据集时,对应的评测结果会变差。这个能力也为后续的数据质量评估提供了坚实支撑。未来,团队计划将这部分魔改代码贡献给lightning项目,并持续跟进其发展。

03 进阶的训练方法

训练方法对大模型而言至关重要,尤其是SLM这个方向。目前已有不少工作指出,chinchilla optimal存在局限性——训练数据规模和模型的比例可以放得更大。团队也尝试用10M、30M、70M、120M的小模型去跑scaling law实验,结果发现:当数据价值足够高的时候,SLM的性能依然能够持续提升。换句话说,scaling law无法衡量数据价值给模型带来的额外增益。

不过,手头已经处理完成的预训练数据仍然有限。经过自研的数据质量评估系统层层筛选,最终保留了1T(3 epoch)tokens的数据。第二阶段继续预训练时,采用了高质量的合成数据。整个训练过程动用两台8卡H800服务器,持续了43天。训练参数设置采用常规方案,且在第二阶段预训练时再次激活余弦学习率——这样做是为了与当前主流预训练模型的训练方法保持一致,便于公平对比。此外,团队还自研了一种模型增量训练方法,能够在模型不遗忘先前知识的前提下持续训练,通过注入新数据持续提升模型能力。

04 系统化的数据质量评估方法

或许这才是csg-wukong-1B最值得关注的技术亮点——OpenCSG自研了一套完整的数据质量评估方法,可以在训练前、训练中、训练后三个不同阶段,精准评估数据对训练带来的影响。

训练前

:采用常规方案,比如Falcon工作中提到的多阶段去重、数据采集时间限制,以及通过开源大参数模型和GPT4对数据质量和安全性进行打分筛选。

训练中

:将训练数据shuffle后依然记录其所属数据集的名称,在训练过程中根据评估指标,精准筛选出质量较低的数据。

训练后

:通过实际应用评测,找出模型对哪一类问题的理解能力不足,然后在下一阶段训练时针对性地补强相关主题数据。值得一提的是,团队还有一些更特别的数据质量评估方案,预计将在不久后逐步公开。

05 csg-wukong-1B模型排名跻身前十

目前,csg-wukong-1B在Huggingface综合性榜单open_llm_leaderboard上排名第8,仅次于阿里的Qwen1.5版本模型。随着更多高质量数据的持续加入以及数据质量评估方法的不断升级,模型对不同问题的理解能力还有望进一步提升。

06 面对挑战 精益求精

坦白说,csg-wukong-1B是OpenCSG首次进行大规模预训练的尝试。在数据类目、数据处理等方面的准备仍有不少提升空间。同时,受限于资源条件,算法模型层面的改进暂时还未完全纳入考量。但团队已经在着手对SLM这类模型进行更深入的调研,并计划在后续阶段努力提出算法模型层面的创新方案。

展望未来,OpenCSG会继续提升csg-wukong-1B这个base模型的通用能力,并逐步开源csg-wukong-1B-chat对话模型、代码生成模型csgcoder以及多模态图文理解模型csg-wukong-1B-VL,以推动更广泛的应用落地。届时,团队也会带来更详细的技术报告,值得期待。