讲这块我不从公式开始。生成器和判别器互相拆台,一个造假一个鉴伪,谁也占不到便宜的时候训练就算到位了,学生听这个比听极小极大好懂得多。往后 StyleGAN 那一支才是真把控制权交出来的:第一代把隐码映射成分层的 style,高层属性和随机细节能分开;第二代重做归一化又加了路径长度正则,那些烦人的水滴斑块没了,反演也好做;第三代干脆从信号处理的角度处理混叠,平移旋转缩放之下画面不再抖。
ControlNet 走的是另一条路,主干锁死不动,用零卷积从零长出可训练参数,边缘、深度、分割、姿态都能当条件塞进去,底模原本学过的东西也不会被冲掉。
GAN 一次前向就出图,快,但容易塌成几种花样;扩散一步步去噪,贵,但样本更杂。
两边解决的从来不是同一个问题。