看到英伟达放出的Nemotron-Labs Diffusion,8B那档,核心卖点是用扩散式语言模型(DLM)一次并行生成多个token,再一轮轮往回精修,而不是老老实实一个一个往外蹦。官方给的数字是自推测模式下每次前向能吐的token量比自回归解码高到6.4倍。
我理解它真正想解决的其实是那个GPU干等着的空窗——传统自回归一步只出一个token,卡的算力大半在排队。并行出token这条路要是稳,对做编程助手、agent工作流、文档类应用这种用户一秒钟卡顿都能感知的场景,体感提升会很直接。
当然那句"speed of light"就是个口号,别当物理定律看。我更关心并行生成后精修那几轮的质量塌不塌,短文本可能没事,长上下文里token之间互相依赖强的时候,并行猜出来再改,会不会前后打架。有没有人上手跑过,实测延迟和输出稳定性怎么样?