有个叫 CAT 的新方法思路挺对我胃口——让 AI 画图的中间草稿都尽量忠于最终成品。扩散模型出图是从噪声一步步去噪,以前很多做法只管最后一张,中间那些半成品跟成品差得远,你想在中途预览、中途干预基本没法看。
CAT 想解决的就是这个:每一步的中间态都和最终画面对齐,这样早早就能看出大概长啥样,不满意可以尽早停、尽早调,不用等它跑满全程才发现方向错了。
对讲课演示扩散原理特别有用,能让学生直观看到「画面是怎么一步步从糊变清的」。落地效果、对生成速度和质量的影响还得看论文细节和实测,但这个「过程可预期」的方向对可控生成很有价值。