把扩散模型压到FP4还不掉色,这套省算力思路值得抄

最近在琢磨怎么把生图的推理成本压下来,一个思路是把diffusion transformer直接跑在4bit(FP4)上。单纯量化到FP4速度是快,但会明显掉色——红色发灰、饱和度整体往下走。原因不难理解:去噪是一步步迭代的,某一步velocity偏一点,下一步latent就跟着偏,误差滚雪球,等出到像素层色彩信息已经没了,后处理补不回来。

真正管用的是训练时就让权重去适应量化噪声,梯度用直通估计绕过rounding,权重自己挪到“被压成4bit也不难受”的区域。

再顺手把CFG的两条分支蒸成一条、把去噪步数也蒸到个位数,每一项都在砍成本的不同轴上。1K分辨率下从2.75秒压到0.44秒,画面跟全精度基本看不出差别,挺狠的。

FP4掉色那段太有共鸣了,latent误差一步步滚起来是真救不回来

关键在训练时让权重适应量化,光量化完再补色纯属白费

latent误差一步步滚那段太真实,步数一低更容易直接崩掉