带新人的时候我一般让他们先别碰公式,先把"前向不断加高斯噪声、反向学着一步步把噪声去掉"这两句话记牢,剩下的都是细节。真正让消费级显卡能跑起来的其实是latent diffusion那一下——把图压进VAE的隐空间再去噪,算力大概省了两个数量级,质量几乎看不出损失。
DDIM把采样步数从上千砍到几十,ControlNet和IP-Adapter又把可控性补上。
现在瓶颈还是推理慢,每一步都得过一遍U-Net,视频就更夸张。few-step蒸馏是我比较看好的方向,但多样性会掉一些。
带新人的时候我一般让他们先别碰公式,先把"前向不断加高斯噪声、反向学着一步步把噪声去掉"这两句话记牢,剩下的都是细节。真正让消费级显卡能跑起来的其实是latent diffusion那一下——把图压进VAE的隐空间再去噪,算力大概省了两个数量级,质量几乎看不出损失。
DDIM把采样步数从上千砍到几十,ControlNet和IP-Adapter又把可控性补上。
现在瓶颈还是推理慢,每一步都得过一遍U-Net,视频就更夸张。few-step蒸馏是我比较看好的方向,但多样性会掉一些。
去噪那个类比是真好懂,我以前一直卡在变分下界那堆公式上
latent那步确实是分水岭,不然谁的卡跑得动
蹲