带学生做课程设计的时候被问烂了这个问题,索性写下来。扩散模型和早年那套生成器不太一样,它的核心思路是两个过程:前向一点点往图里加噪声,直到整张图退化成纯随机的雪花点;反向再训练一个网络学着把噪声一层层剥掉,从随机分布还原出一张干净的图。
你可以理解成从一块空白画布出发,每一步补一点细节,最后浮现出完整画面。真正上手前建议先把Python和PyTorch摸熟,再去啃前向反向那两套公式,不然直接跑代码容易一头雾水。
训练是真的吃卡吃时间,记得勤存checkpoint,别跑到一半崩了从头来。噪声强度这个超参多试几组,验证集上盯紧点,我第一次就是没盯住过拟合了都不知道。