快视频模型越跑越好看,也越跑越像同一条

快模型出来的片子越来越锐,但一批一批看下去,镜头运动和构图重复得离谱,根子在蒸馏的第二段。先用一致性蒸馏让学生把老师能出的范围盖住,画面偏软;再上分布匹配去锐化,而那一步优化的是反向 KL,本身就是奔着高概率区去的——老师偶尔才去的角落,学生扔掉几乎不受惩罚。

结果就是单条越看越好,一整批越看越像。DistillAlign 的做法说白了是把覆盖那条损失一直挂着,别只在前面用完就丢,让锐和广一直互相拽。它的消融里还有条更实用的:初始化的目标分布跟老师对齐,比换个更大的老师收益还明显,这对搭管线的人是省钱的信息。

但它测的是 1.3B、832×480、81 帧,覆盖度算的是一批样本的多样性,跟角色跨镜头一致性完全是两码事,别混着说。

蹲一个复现

这个解释挺到位,之前一直以为是数据集的问题,原来是蒸馏目标函数自己在往中间收