投机解码开源出完整框架了,但两倍加速这个口径得看清楚

投机解码以前多半是各家自己糊一套,现在有了端到端的开源框架。腾讯混元放出的 AngelSpec 训练和部署都覆盖,Hy3-A21B 的 MTP 和 DFly 草稿模型权重连着训练代码一起开源。

数字上,DFly 方案相对自回归解码是 1.98 到 2.40 倍端到端加速,吞吐比 DFlash 高 10.5% 到 11.8%。这个区间跨度不算小,说明加速比很吃任务分布——短回答、结构化输出这类可预测性高的场景接受率高,容易跑到上限;开放式长文本大概率落在下沿。看这种指标先问基线是什么、测的哪类任务,不然两倍很容易被当成通用结论到处引。

我觉得真正值钱的是草稿模型权重一起放了,自己从头训一个草稿模型的成本才是这套东西的真门槛。

加速比吃任务分布这条说到点了,我们线上跑下来跟宣传值差了一截

草稿模型权重一起给才实在,不然框架摆那儿也用不起来

蹲一个真机复现