AngelSpec:腾讯开源统一投机解码草稿模型训练框架
一、AngelSpec是什么
先说说我的理解。最近腾讯混元AI基础设施团队开源了一个叫AngelSpec的东西,本质上是一个基于PyTorch构建的工业级投机解码草稿模型全流程训练框架。说白了,就是一套专门用来训练“草稿模型”的工具链,目标是把大模型推理加速这件事做得更扎实。
这个框架打通了训练、在线评估和分布式部署的整条链路,原生适配Qwen和腾讯混元(Hunyuan/Hy3)这些主流大模型基座。对那些做科研的和大模型线上推理工程团队来说,最头疼的痛点——比如传统草稿模型训练框架架构碎片化、训练和推理割裂、长上下文支持弱、线上真实效果难以验证——AngelSpec算是给出了一个比较完整的解决方案。
二、功能特色
从功能设计来看,AngelSpec确实下了不少功夫,几个关键点值得关注。
多架构统一训练入口
单个框架就支持6大类主流草稿模型架构,改改配置文件就能切换方案。涵盖DFly、DFlash、DFlare、Eagle3、MTP、DSpark,基本覆盖了块并行、自回归TTT、混合这三大技术路线。长上下文原生支持
集成Ulysses序列并行技术,最高能支持128k上下文长度训练。内置了40k上下文开箱即用的训练配置,对于超长文本、文档问答这类场景下的投机解码优化,适配性很强。多样化损失函数组合
内置了CE损失、KL散度、LK损失、D-PACE权重、TV损失等多种目标函数,可以自由组合调优。关键点在于,这能直接提升草稿Token被主模型接受的概率,从而影响推理加速的实际效果。文档感知样本打包机制
采用Megatron风格的定长序列打包,强制隔离不同文档样本,避免跨文档污染的问题。MTP和DFlash这两条核心训练链路都通用。训练阶段在线仿真评估
训练过程中可以直接对接vLLM或SGLang推理引擎,实时运行真实的投机解码流程。输出平均接受长度、逐位置Token接受率这些线上核心指标,不再只是依赖离线损失来判断模型优劣,这确实是个很大的进步。训练/推理集群解耦分布式架构
依托Mooncake张量存储实现训练集群和推理集群分离部署,两类算力可以独立扩容。对于线上高并发业务需要持续微调草稿模型的场景,这个设计很实用。完善工程化配套
提供了单节点、多节点分布式训练脚本、环境一键构建脚本、单元测试、完整文档,兼容主流CUDA 12.x环境,支持续训和从零初始化两种训练模式。工程化层面考虑得比较周全。

六、竞品对比
咱们把当前投机解码训练领域主流的开源框架拉出来做个横向对比,这样更直观。
| 项目名称 | AngelSpec(腾讯) | Eagle Training Code | vLLM Spec Train |
|---|---|---|---|
| 开发主体 | 腾讯混元AI Infra团队 | 耶鲁大学开源社区 | vLLM官方团队 |
| 支持Drafter架构 | DFly/DFlash/MTP/Eagle3等6种架构 | 仅Eagle系列架构 | 原生MTP,架构扩展性有限 |
| 训推分离分布式 | 支持(Mooncake) | 不支持,训推同集群 | 不支持 |
| 超长上下文训练 | 最高128k(Ulysses并行) | 有限支持 | 依赖外部并行方案 |
| 训练实时投机评测 | 原生内置 | 需要自行开发对接 | 仅离线损失评估 |
| 适配基座 | Qwen、Hy3等稠密/MoE模型 | 稠密通用基座 | 主流稠密模型,MoE适配较弱 |
| 工程配套 | 完整脚本、配置、单元测试 | 最简实验代码,工程化薄弱 | 偏向推理,训练工具链不完善 |
七、常见问题解答
Q:AngelSpec只能使用腾讯混元大模型吗?
A:不是。框架原生支持Qwen系列模型,同时兼容主流稠密大模型、MoE混合专家模型,任何开源基座只要格式适配,都可以用来训练草稿模型。
Q:运行AngelSpec必须搭配vLLM吗?
A:不是。框架同时支持vLLM、SGLang两种推理后端,可以根据自身部署环境自由选择,只需要安装对应后端依赖包。
Q:Mooncake组件是强制依赖吗?单机训练场景是否可以移除?
A:Mooncake主要用于多集群训推分离场景。单节点小规模训练场景,不需要部署Mooncake,可以关闭分布式跨集群通信功能正常运行训练。
Q:AngelSpec训练出来的草稿模型,可以直接在其他推理框架使用吗?
A:模型权重为标准PyTorch格式,导出后可以适配支持对应投机解码方案的推理引擎。需要注意架构匹配,DFly、DFlash等自研架构需要推理侧实现对应解码逻辑。
Q:普通消费级显卡能否运行AngelSpec?
A:小规模测试、小基座模型(如8B)可以在高端消费显卡开展实验。正式训练草稿模型、128k长上下文训练,建议使用数据中心专业GPU。
Q:框架是否提供预训练好的草稿模型权重?
A:配套项目AngelSlim发布了多套预训练Drafter权重,包含Hy3、Qwen3-8B适配版本,可以直接下载用于推理或二次微调。
八、相关链接
GitHub开源仓库:https://github.com/Tencent/AngelSpec
arXiv论文地址:https://arxiv.org/abs/2607.25852
Hugging Face模型库:https://huggingface.co/collections/AngelSlim/angelspec
九、总结
AngelSpec是腾讯推出的一体化投机解码草稿模型训练工具链,整合了当下多种主流Drafter模型训练方案。它补上了现有开源工具架构单一、缺少在线评测、无法实现训推集群解耦的短板,兼顾了科研实验的快速迭代与线上大模型推理业务的工程落地需求。开发者可以依托这套框架快速训练出适配自有大模型的草稿模型,借助投机解码技术有效降低LLM推理延迟、提升服务整体吞吐。