从 VAE 到 Diffusion,AI 绘画这条技术线其实脉络很清晰

想跟大家掰扯下图像生成这条技术演进线。早期 VAE 走的是编码到隐空间再重建那套,好处是训练稳、可控,但生成的图偏糊,细节撑不起来。后来 GAN 靠对抗博弈把清晰度拉上去了,代价是训练极不稳定、容易模式崩溃,调参跟玄学一样。

真正把画质和多样性同时做上去的是 Diffusion,从纯噪声一步步去噪还原,思路上更接近逐步雕刻。现在主流生图基本都在扩散这条路上,再叠 latent、加各种条件控制。

理解了这条线,再看现在的采样器、调度器那些参数就不至于纯背概念。有一说一每一代都不是推翻前一代,隐空间这些老思路到今天还在被复用。

正在补这块,mark :pray:

GAN 训练崩起来是真的劝退,我当年为了稳住一个判别器熬了好几个通宵

写得清楚

补一句,扩散慢的问题现在靠蒸馏和少步采样在补,趋势又往效率上走了

我们这种非技术的看个大概脉络就够了,谢谢科普

每一代不是推翻前一代这句到位,其实很多领域都这样

1 个赞

GAN判别器一崩就前功尽弃,当年为稳住它熬的夜想想都后怕