腾讯开源 AngelSpec 框架:破解大模型真实推理效率难题
来源:互联网
时间:2026-07-30 14:22:09
在当前大模型规模与服务需求持续增长的背景下,如何降低自回归解码的高昂成本,已成为行业普遍关注的核心痛点。为此,腾讯技术团队正式开源了统训框架,旨在通过多方案协同与工作负载异构适配,全面提升大模型在真实场景中的推理吞吐量,降低部署成本。AngelSpec
核心机制:差异化训练策略
针对不同应用场景下文本特征的差异,采用了差异化的训练策略,以兼顾效率与效果。AngelSpec
- :系统采用轻量且稳定的多token预测机制(MTP),并结合训练时测试(TTT)和端到端总变差损失,使其能够有效适应自回归展开中的状态分布,提升对话流畅性与多样性。
高熵、开放式多轮对话任务
- :面对结构约束更强的任务,系统通过专有的块扩散模型进行强化,充分挖掘长跨度可预测序列的潜力,显著提升逻辑推理与代码生成的准确性。
代码生成与数学推理任务

性能验证:显著提升吞吐量
在Hy3模型系列的系统测试中,搭载方案的AngelSpec展现出显著的性能优势。在并发数从4到64的各项测试中,该方案均实现了最高的平均吞吐量,相比传统的自回归解码提升显著,为大模型的工程化落地与高效推理提供了坚实的开源工具支持。DFly
小提示
常见问题
AngelSpec是否支持所有主流大模型架构?
目前AngelSpec主要针对自回归解码模型(如GPT系列、LLaMA系列)进行优化,但框架设计具备通用性,可通过适配接口支持其他架构。具体兼容性请参考项目文档。
部署AngelSpec需要额外硬件支持吗?
无需特殊硬件,AngelSpec在现有GPU集群(如NVIDIA A100、H800等)上即可运行,推荐使用最新CUDA环境以获得最佳性能。
如何获取源码和详细文档?
项目完整代码与使用说明已托管在GitHub,欢迎访问:https://github.com/Tencent/AngelSpec。同时,学术论文详情可查阅:https://arxiv.org/pdf/2607.25852。
综上所述,作为腾讯开源的统训框架,通过多方案协同与工作负载异构适配,有效解决了大模型推理中的成本与效率问题,为行业提供了直接可用的开源工具,值得关注与尝试。AngelSpec