给学生捋 GAN,我一般顺着 StyleGAN 这条线往下走

讲这块我不从公式开始。生成器和判别器互相拆台,一个造假一个鉴伪,谁也占不到便宜的时候训练就算到位了,学生听这个比听极小极大好懂得多。往后 StyleGAN 那一支才是真把控制权交出来的:第一代把隐码映射成分层的 style,高层属性和随机细节能分开;第二代重做归一化又加了路径长度正则,那些烦人的水滴斑块没了,反演也好做;第三代干脆从信号处理的角度处理混叠,平移旋转缩放之下画面不再抖。

ControlNet 走的是另一条路,主干锁死不动,用零卷积从零长出可训练参数,边缘、深度、分割、姿态都能当条件塞进去,底模原本学过的东西也不会被冲掉。

GAN 一次前向就出图,快,但容易塌成几种花样;扩散一步步去噪,贵,但样本更杂。

两边解决的从来不是同一个问题。

把三代的改动一句一句对着讲,学生上手确实比啃论文快

1 个赞

码住

水滴伪影那个我当年调了半天,一直以为是自己数据脏

零卷积的设计是真优雅,从零长出来所以一开始不会破坏底模

模式崩塌到现在也没根治吧,只是大家不太用 GAN 了 :thinking:

现在入门直接上扩散,GAN 这条线快变考古学了