在当前大模型规模与服务需求持续增长的背景下,如何降低自回归解码的高昂成本成为了行业的一大痛点。为此,腾讯技术团队正式开源了统训框架AngelSpec,旨在通过多方案协同与工作负载异构适配,全面提升大模型在真实场景中的推理吞吐量。

针对不同应用场景下文本特征的差异,AngelSpec采取了差异化的训练策略。对于高熵、开放式的多轮对话任务,系统采用轻量且稳定的多token预测机制(MTP),并结合训练时测试(TTT)和端到端总变差损失,使其能够有效适应自回归展开中的状态分布;而面对结构约束更强的代码生成与数学推理任务,则通过专有的块扩散模型进行强化,充分挖掘长跨度可预测序列的潜力。

腾讯开源 AngelSpec 框架:破解大模型真实推理效率难题

在架构设计上,该框架提出了名为 DFly 的创新块扩散框架。它通过混合目标条件编码骨干与前序条件自回归头,在保持高吞吐量并行生成的同时,大幅优化了目标特征利用率与块内依赖建模。此外,系统引入了动态验证机制,可结合当前在线负载、硬件条件及前缀置信度,在运行时自适应调整验证深度,从而在计算资源与吞吐效率之间实现平衡。

腾讯开源 AngelSpec 框架:破解大模型真实推理效率难题

在 Hy3模型系列的系统测试中,搭载 DFly 的方案展现出显著的性能优势。在并发数从4到64的各项测试中,该方案均实现了最高的平均吞吐量,相比传统的自回归解码提升显著,为大模型的工程化落地与高效推理提供了坚实的开源工具支持。

项目地址:https://github.com/Tencent/AngelSpec

论文:https://arxiv.org/pdf/2607.25852