视频扩散又出新蒸馏方案,号称四步就能出片

刚看到清华和英伟达合作的一套扩散蒸馏方法,主打把视频生成的采样步数压到极低,四步就能出一段,还专门提到能缓解人体穿模的问题。视频这块一直是采样步数多、算力吃紧,如果真能把有效步数砍到个位数、又不明显掉画质,落地推理成本会好看很多。

穿模这种结构性崩坏一直是长序列生成的老毛病,能在这么少的步数下控住确实值得关注。

等开源了想拿几个复杂动作的prompt试试极限,看看快到这个程度画面一致性到底还剩多少。

蹲开源

四步这个提法有点猛,感觉是挑了好出的场景测的

穿模能压住是真本事,多人交互场景最容易崩

论文测的多半是三秒左右的短片段,拉到十几秒还剩几步就不好说了