投机解码以前多半是各家自己糊一套,现在有了端到端的开源框架。腾讯混元放出的 AngelSpec 训练和部署都覆盖,Hy3-A21B 的 MTP 和 DFly 草稿模型权重连着训练代码一起开源。
数字上,DFly 方案相对自回归解码是 1.98 到 2.40 倍端到端加速,吞吐比 DFlash 高 10.5% 到 11.8%。这个区间跨度不算小,说明加速比很吃任务分布——短回答、结构化输出这类可预测性高的场景接受率高,容易跑到上限;开放式长文本大概率落在下沿。看这种指标先问基线是什么、测的哪类任务,不然两倍很容易被当成通用结论到处引。
我觉得真正值钱的是草稿模型权重一起放了,自己从头训一个草稿模型的成本才是这套东西的真门槛。