用CLIP潜空间做分层文本条件生图,这个方向影响挺深远

这套"用CLIP潜空间、分层做文本条件图像生成"的思路,现在回头看是影响了后面一大批模型的底层做法。我给学生讲AI生图原理的时候经常会拆到这一层:文字先被编码成一个语义向量,模型再一层层把这个向量还原成图像,等于是先想清楚"要画什么意思",再去落笔画细节。

这跟我们教画画的顺序其实有点像,先立意再铺大形最后抠细节。理解了这个分层的逻辑,学生再去用各种生图工具就不会只当黑箱,遇到出图跑偏也更能猜到是哪一层没对上。

原理这东西不用钻得太深,但知道个大概框架,用起工具来心里有底。

拿它跟画画顺序类比,学生应该好懂多了

先立意再铺形,这个比喻收藏了

1 个赞

把工具当黑箱确实容易用废

老师讲得清楚 :clap:

这篇算是后面一堆模型的地基了