Macaron-V1 - MindLab 推出的后训练多能力模型系统
来源:互联网
时间:2026-07-23 15:21:11
Macaron-V1 是什么?
Macaron V1 是 MindLab 推出的后训练多能力模型系统,基于 GLM 5.2 基座,通过强化学习对约 0.5% 核心参数进行 LoRA 微调。系统独创 Mixture-of-LoRA(MoL)架构,挂载 Chat、Agent、Coding、UI 四个独立专家,由 Router 按需激活,彻底消除能力干扰。Macaron V1 提供旗舰版 Venti 与轻量版 Tall,覆盖对话、智能体、编程与交互式 UI 生成,实测生成速度达 320 字/秒。
Macaron-V1 的主要功能
- :冻结基座,仅训练 0.5% 核心参数,四个独立 LoRA 专家隔离优化,互不干扰,新增能力只需再挂一个 LoRA。
MoL 后训练架构
- :旗舰 Venti(748B,基于 GLM 5.2,原生 1M 上下文扩展至 2M);轻量 Tall(35B,基于 Qwen 3.6,本地部署优化)。
双模型变体
- :UI4A 通用生成式 UI 架构,渲染交互式视图;REPL Harness 持久 Python 环境,模型自写工具并提升为全局工具;MinT 自研训练平台,仅传递 Adapter,支持百万级目录与万亿参数。
三大配套系统
- :Macaron ChatBench 支持长上下文诚实对齐,LivingBench 动态沙盒环境验证持续理解与任务重规划。
自建评测基准
- :API 实测 320 字/秒,34.3 秒完成 10,975 字长文。
极致生成速度
Macaron-V1 的技术原理
- :冻结 GLM 5.2 基座全部权重,仅提取约 0.5% 的核心参数构建四个独立的 LoRA 专家模块,分别专精 Chat、Agent、Coding、UI 四大能力方向。每个专家在隔离的适配空间中独立优化,彻底消除多能力联合训练时常见的“按下葫芦浮起瓢”式相互干扰问题。用户输入经显式 Router Tool 路由至对应专家,实现按需激活与资源高效利用。
MoL(Mixture-of-LoRA)架构
- :基于自研 LongStraw 技术,将 GLM 5.2 原生 1M 上下文窗口扩展至 2M。核心机制是将共享提示词复用为常驻状态,避免长序列中重复计算带来的开销,大幅降低长上下文推理的资源消耗与延迟,使模型在处理超长文档、多轮复杂对话时保持高效稳定。
LongStraw 长上下文扩展
- :MindLab 自研的后训练基础设施,核心设计突破传统分布式训练中 Actor 与 Learner 需传递完整权重的瓶颈,改为仅传递轻量 Adapter。这一设计天然契合 MoL 架构,支持百万级 Adapter 目录管理,端到端可覆盖万亿参数规模模型的强化学习训练,显著降低通信带宽与存储压力。
MinT 分布式训练平台
- :区别于依赖人工标注或静态基准的训练范式,Macaron 强调来自真实产品环境的奖励信号。团队自建 Macaron ChatBench 与 LivingBench 两个动态评测基准:前者考察长上下文中的诚实对齐与任务完成能力,后者在包含动态噪声、动态环境与动态用户的沙盒中验证模型的持续理解、信息验证与任务重规划能力,确保模型在真实交互中持续进化。
真实环境驱动的奖励函数
如何使用 Macaron-V1
Macaron V1 处于内测阶段,可通过 macaron 网关 https://mintcn.macaron.xin 调用 API。
小提示:内测期间 API 调用无需额外申请,直接访问网关即可体验。建议优先尝试轻量版 Tall 进行本地测试,旗舰版 Venti 适合高阶场景。
Macaron-V1 的核心优势
- :MoL 架构让各专家独立优化,彻底避免多能力混训时的性能此消彼长。
能力隔离不互扰
- :新增能力仅需挂载新 LoRA,无需重新训练整个模型,灵活组合。
极低成本扩展
- :LongStraw 技术将上下文扩展至 2M,且通过状态复用降低长序列开销。
超长上下文支持
- :自建动态评测基准,模型在模拟真实噪声与动态用户的环境中持续迭代。
真实环境进化
- :实测 320 字/秒,远超市面主流模型,首 token 响应后持续稳定输出。
生成速度领先
Macaron-V1 的同类竞品对比
| 维度 | Macaron V1 | GPT 5.5 |
|---|---|---|
训练范式 |
后训练(基于 GLM 5.2) | 端到端预训练 + RL |
参数效率 |
仅训练 0.5% 参数(LoRA) | 全参数训练 |
能力扩展 |
挂载新 LoRA 即可,灵活组合 | 需重新训练整个模型 |
架构特色 |
MoL 多专家隔离,互不干扰 | 单一模型端到端优化 |
上下文长度 |
2M(LongStraw 扩展) | 128K-1M |
生成速度 |
320 字/秒 | 中等 |
UI 生成 |
原生支持(UI4A) | 不支持 |
自写工具 |
原生支持(REPL Harness) | 不支持 |
ChatBench |
58.3 | 55.5 |
LivingBench |
64.0 | 61.9 |
PinchBench |
94.0 | 89.0 |
TerminalBench 2.1 |
87.6 | 83.4 |
UI4ABench |
87.8 | 72.1 |
Macaron-V1 的应用场景
- :Venti 面向高阶场景,提供稳定可靠的推理与执行能力。
企业级复杂任务处理
- :支持工具调用、任务规划与动态环境交互,适用于自动化工作流。
智能 Agent 开发
- :覆盖代码生成、调试、算法开发及 SWE 任务,TerminalBench 2.1 得分 87.6。
代码生成与工程化
- :通过 UI4A 渲染可交互界面,适用于前端原型与可视化表达。
交互式 UI 自动生成
- :Tall 版本低成本、开箱即用,适合个人开发者与边缘设备集成。
本地轻量部署
常见问题
Q:Macaron V1 的 Venti 和 Tall 版本有什么区别?
A:Venti 基于 GLM 5.2,参数规模 748B,支持 2M 上下文,适合高精度、长上下文场景;Tall 基于 Qwen 3.6,参数 35B,专为本地部署和边缘设备优化,成本更低。Q:如何将 Macaron V1 集成到现有项目中?
A:通过 RESTful API 调用,地址为https://mintcn.macaron.xin,支持标准 HTTP 请求。文档内测期间会逐步开放,建议先查看示例代码进行调试。Q:Macaron V1 的 MoL 架构是否支持自定义专家?
A:支持。新增能力只需挂载一个新的 LoRA 模块,无需重新训练基座模型,适合快速扩展特定领域功能。
Macaron V1 以其创新的 MoL 架构、极低的训练成本、超长上下文和领先的生成速度,为多能力 AI 模型提供了一种高效、灵活的新范式。无论是企业级部署还是个人研发,都能在性能与成本之间找到最佳平衡点。