想跟大家掰扯下图像生成这条技术演进线。早期 VAE 走的是编码到隐空间再重建那套,好处是训练稳、可控,但生成的图偏糊,细节撑不起来。后来 GAN 靠对抗博弈把清晰度拉上去了,代价是训练极不稳定、容易模式崩溃,调参跟玄学一样。
真正把画质和多样性同时做上去的是 Diffusion,从纯噪声一步步去噪还原,思路上更接近逐步雕刻。现在主流生图基本都在扩散这条路上,再叠 latent、加各种条件控制。
理解了这条线,再看现在的采样器、调度器那些参数就不至于纯背概念。有一说一每一代都不是推翻前一代,隐空间这些老思路到今天还在被复用。