INT8 别一刀切,首尾几层留高精度画质差一截

手头这张卡显存一直吃紧,Z-Image 跑 BF16 得掐着算,索性自己折腾了一版混合精度 INT8。折腾下来最大的体会是量化真不能一刀切:把比较敏感的模块、加上前面几层和末尾几层留在高精度,出图的边缘毛刺和暗部噪点会收敛得很明显;全量 INT8 是更快,但细节容易糊一层,头发丝、金属反光这种地方最先垮。

混合版比普通 INT8 慢一点点,换来的画质基本能贴回 BF16,显存也降下来了,这个取舍我觉得划算。

Base 和 Turbo 各做了一份,新版 ComfyUI 里直接加载没报错。至于快多少,别抄别人的数字,显卡和工作流一变差距能拉很开,自己跑一遍最准。

蹲一个

1 个赞

保留首尾层这个思路我在别的模型上也试过,确实是毛边杀手,暗部差别最明显

12G 的卡表示太需要了,BF16 基本属于开一次泡一壶茶

普通 INT8 我跑过,头发糊成一团,当时还以为是采样器没调好

想问下 Turbo 那版量化完步数还能压到原来那么低吗,会不会得多加两步补细节