刚注意到 D-OPSD 这个方法,瞄准的是步数蒸馏之后的扩散模型怎么持续微调。以前把多步模型蒸成几步的快模型,好处是快,但蒸完想再针对新数据或新风格调整就很别扭,一不小心就把好不容易蒸出来的少步能力搞崩。
它用 on-policy 的自蒸馏,让模型拿自己当前采样的结果做在线蒸馏,边调边守住少步生成的质量。
对我们这种线上要快模型、又得隔三差五换风格的场景挺对口。具体收益还得看它在什么基座、蒸到几步上验证的,光标题看不出量化效果,得找到论文再细读。
刚注意到 D-OPSD 这个方法,瞄准的是步数蒸馏之后的扩散模型怎么持续微调。以前把多步模型蒸成几步的快模型,好处是快,但蒸完想再针对新数据或新风格调整就很别扭,一不小心就把好不容易蒸出来的少步能力搞崩。
它用 on-policy 的自蒸馏,让模型拿自己当前采样的结果做在线蒸馏,边调边守住少步生成的质量。
对我们这种线上要快模型、又得隔三差五换风格的场景挺对口。具体收益还得看它在什么基座、蒸到几步上验证的,光标题看不出量化效果,得找到论文再细读。
蒸完再调容易崩这个痛点是真的,我们也吃过亏
on-policy 自蒸馏,边采样边蒸,思路挺清晰
mark
就怕它只在小基座上验证过,放大不一定还成立