模型发布

腾讯混元开源 AngelSpec 投机解码框架:端到端加速可达 2.4 倍

腾讯混元开源端到端投机解码框架 AngelSpec,在 Hy3-A21B 上实现 1.98–2.40 倍加速,吞吐量比 DFlash 高 10.5–11.8%,训练代码与草稿模型权重一并放出。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
腾讯混元开源 AngelSpec 投机解码框架:端到端加速可达 2.4 倍

腾讯混元在 X 平台宣布开源端到端投机解码框架 AngelSpec,同时放出 Hy3-A21B 模型的 MTP/DFly 草稿模型权重。这是一套兼顾训练与部署的方案,不是只丢出一个推理脚本。对正在找推理加速方案的团队来说,这是一份可以直接上手的工程底料。

投机解码(Speculative Decoding)的思路并不新:用一个小模型先猜几个 token,再让大模型一次性验证,从而减少串行生成的开销。真正难的地方在于训练侧和推理侧的协同——草稿模型猜得太保守,加速有限;猜得太激进,又容易被大模型否决,等于白跑。

核心数据:1.98–2.40 倍端到端加速

在 Hy3-A21B 这个 21B 级别的模型上,AngelSpec 的 DFly 方案相对自回归解码拿到了 1.98 到 2.40 倍 的端到端加速。这意味着同样一张卡、同样的输入,吞吐差不多能翻倍。对在线推理服务来说,这是肉眼可见的成本差。

比 DFlash 高出 10.5–11.8%

横向对比的对象 DFlash 是近期被讨论较多的投机解码工作。官方数据显示 AngelSpec 的吞吐量比 DFlash 高出 10.5% 到 11.8%。这个数字不算碾压,但放在开源方案里,已经足以让做推理优化的工程师重新算一遍成本账。

这次开源的范围比较完整:训练代码、Hy3-A21B 的 MTP/DFly 草稿模型权重一起放出来。换句话说,团队不只能跑一个 demo,还可以基于这套流程在自己模型上重新训练草稿模型。这是判断一个开源项目能不能落地的关键指标。

对开发者和企业用户意味着什么

对开发者来说,最直接的价值是 省去从零搭建投机解码链路 的时间。草稿模型怎么训、推理引擎怎么接、采样策略怎么调,AngelSpec 把流程端到端摊开了。中小团队不必再靠读论文加改 vLLM 源码来摸索。

对企业用户来说,加速倍数背后是 单次推理成本 的下降。在 API 价格战已经打到分厘的场景里,自己部署的成本优势反而在变大。做长文本、多轮对话、批量生成的企业,能拿到接近翻倍的吞吐,意味着同等算力下可服务的用户量也接近翻倍。

中文用户应该关注什么

对国内开发者而言,这次开源的实操门槛比较低。Hy3-A21B 是混元自己的模型,权重直接给,意味着可以 先复现、再迁移。如果你正在用其他 7B 到 20B 级别的开源模型,可以参照 AngelSpec 的训练范式,把草稿模型换成自己模型的蒸馏版本。

另外值得注意的一点是 AngelSpec 的

定位。它不是只覆盖推理阶段,而是把训练和部署都包了。这种 训练-部署一体化 的设计,更适合需要长期维护的工程项目,而不是跑一次就跑的实验。

后续观察点

接下来值得看的是 AngelSpec 是否会接入主流推理框架,比如 vLLM、SGLang、TensorRT-LLM。如果只是独立的 demo 仓库,工程价值会打折;如果能变成框架内的可选项,才真正进入生产链路。

还有一个风险点是 不同模型族之间的迁移效果。官方数字是在 Hy3-A21B 上跑出来的,换到 Llama、Qwen、DeepSeek 系列后,加速比和草稿模型的命中率是否还能维持,需要社区实测。这会是接下来一个月里 GitHub Issue 和技术博客里讨论的焦点。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具