最近在琢磨怎么把生图的推理成本压下来,一个思路是把diffusion transformer直接跑在4bit(FP4)上。单纯量化到FP4速度是快,但会明显掉色——红色发灰、饱和度整体往下走。原因不难理解:去噪是一步步迭代的,某一步velocity偏一点,下一步latent就跟着偏,误差滚雪球,等出到像素层色彩信息已经没了,后处理补不回来。
真正管用的是训练时就让权重去适应量化噪声,梯度用直通估计绕过rounding,权重自己挪到“被压成4bit也不难受”的区域。
再顺手把CFG的两条分支蒸成一条、把去噪步数也蒸到个位数,每一项都在砍成本的不同轴上。1K分辨率下从2.75秒压到0.44秒,画面跟全精度基本看不出差别,挺狠的。