Nanbeige4.2-3B - 南北阁实验室推出的通用Agent小模型
来源:互联网
时间:2026-07-27 14:26:29
Nanbeige4.2-3B是什么
先说几个关键点:Nanbeige4.2-3B是BOSS直聘南北阁实验室推出的一款通用Agent小模型。别看它只有3B参数,在代码智能体、办公工作流、复杂工具调用这类Agent任务上,它直接超越了Qwen3.5-9B和Gemma4-12B这样的大模型。
这背后靠的是Looped Transformer架构,用来提升有效容量。同时,团队还构建了一套代码、工具、办公三类Agent数据的闭环合成管线,配合三阶段课程SFT和多阶段RL训练。最终结果就是:推理成本降下来了,但Agent能力依然很强。目前模型已经开源,并且适配了多种推理引擎。
Nanbeige4.2-3B的主要功能
- :能在真实代码仓库里浏览、定位问题、完成修改并运行验证,覆盖软件工程全流程。
代码智能体
- :能处理文档、表格、幻灯片、PDF等跨格式文件,支持多文件依赖和长流程办公工作流。
办公智能体
- :支持MCP在线服务、本地Python工具及虚拟工具的链式调用与参数推断。
复杂工具调用
- :覆盖数学、代码与科学推理,在GPQA Diamond、HMMT等评测上,拿下了同规模最佳成绩。
通用推理
- :具备多轮规划、文件处理与错误恢复能力,可以低门槛部署为本地Agent助手。
本地个人助手
Nanbeige4.2-3B的技术原理
为什么能做到这一点?核心在于几个关键设计:
- :模型的隐藏状态在通过全部Transformer层后,会再次回送到同一组层进行第二遍计算。这意味着在不增加参数量的前提下,有效计算深度提升了。实验证明,循环两遍在效果与稳定性之间能取得最佳平衡,而且不共享KV Cache,以效果优先。
Looped Transformer架构
- :语料从23T扩展到了28T tokens,对数学、代码和合成QA数据采取了激进的上采样策略。这让小模型在推理和知识评测上,全面领先同规模基座。
预训练数据上采样
- :针对代码智能体,构建了“训练—失败分析—数据补充”的飞轮;针对工具调用,设计了真实MCP、本地Python与虚拟工具三类环境,并随模型能力演化而调整难度;针对办公智能体,则建立了素材聚类、任务生成、产出回收的闭环反馈。
Agent数据闭环合成
- :按64K→128K→256K逐步提升Agent数据占比。对错误轮次设置Loss Mask,保留错误上下文但不学习错误动作,让模型学会在真实错误历史上修正任务。
三阶段课程SFT
- :先通过Think/Non-Think两阶段RLHF稳定生成质量;再进行带长度控制的Reasoning RL,减少简单问题上的无效Token;最后结合Outcome Reward与Action-Centric Rubric进行Agentic RL,选择轨迹较短且已有成功率的任务进行训练,提升稳定性。
多阶段RL配方
如何使用Nanbeige4.2-3B
- :从Hugging Face下载Agent模型(Nanbeige4.2-3B)或Base模型(Nanbeige4.2-3B-Base)的权重文件。
获取模型权重
- :用已适配的Transformers、SGLang、vLLM、llama.cpp或Ollama等引擎加载模型。3B参数对硬件要求很低,适合本地PC或边缘设备部署。
选择推理引擎
- :根据任务复杂度选择思考模式(Think)进行深度推理,或选择非思考模式(Non-Think)进行快速响应,两种模式可以灵活切换。
切换推理模式
- :将模型接入OpenClaw等Agent框架,配置外部工具和Scaffold,就可以执行多步代码、办公或研究任务。
接入Agent框架
Nanbeige4.2-3B的核心优势
- :3B参数在Agent任务上稳定超越9B/12B级模型,大幅降低高频调用场景的推理成本。
小参数大能力
- :Looped Transformer在固定参数下压榨出有效容量,相比标准Transformer获得了约75%的token efficiency收益。
架构创新
- :三类Agent数据都构建了闭环反馈与难度演化机制,训练数据随模型能力同步提升,而不是停滞不前。
数据飞轮
- :SFT错误掩码保留错误上下文但不学习错误动作,RL多阶段配方兼顾了准确率提升与输出长度下降。
训练精细
- :已适配主流推理引擎,支持Think/Non-Think双模式,适合本地部署与成本敏感场景。
低门槛部署
Nanbeige4.2-3B的项目地址
- :
HuggingFace模型库
- https://huggingface.co/Nanbeige/Nanbeige4.2-3B
- https://huggingface.co/Nanbeige/Nanbeige4.2-3B-Base
- :https://huggingface.co/Nanbeige/Nanbeige4.2-3B/blob/main/Nanbeige42_report.pdf
技术论文
Nanbeige4.2-3B的同类竞品对比
| 对比维度 | Nanbeige4.2-3B | Qwen3.5-4B |
|---|---|---|
| 非Embedding参数量 | 3B | 4B |
| General Agent(PinchBench-V2) | 74.7 | 63.9 |
| Code Agent(SWE-Bench Verified) | 63.6 | 38.8 |
| 办公任务(GDPval) | 68.8 | 37.0 |
| 推理能力(GPQA) | 53.3 | 43.1 |
| 架构特色 | Looped Transformer | 标准Transformer |
| 部署门槛 | 更低,适配多引擎 | 标准部署 |
Nanbeige4.2-3B的应用场景
- :在开发者本地环境执行代码仓库浏览、Bug修复、补丁验证等软件工程任务。
本地代码开发
- :自动处理跨格式文档、表格与幻灯片,完成数据整理、报告生成及格式转换。
办公工作流自动化
- :通过MCP协议调用在线服务与本地工具,实现信息检索、数据分析与多步骤任务编排。
智能工具编排服务
- :部署在PC或NAS等本地设备,作为低延迟、隐私可控的通用Agent助手。
边缘设备个人助手
- :在需要数十到上百次模型调用的复杂Agent系统中,替代大模型,显著降低运营成本。
高频Agent系统核心引擎