这份是Krea 2 Raw base慢档的HQ Int8 Row ConvRot量化,从官方BF16转的。作者贴的对比数字挺有说服力:Int8 ConvRot跟BF16的相似度到96.
2%,而GGUF Q8只有90.0%,FP8 Scaled 82.2%,NVFP4更是掉到63.7%。速度上Int8 ConvRot出一张3.05秒,BF16要5.
56秒,快了1.82倍;NVFP4是3.8秒,GGUF Q8反而6.06秒、比BF16还慢一点。也就是说这套在质量几乎不掉的前提下把速度干上去了,配他们的ComfyUI后端,在3000、4000、5000系上比FP8 Scaled快一倍。
代价是量化本身不便宜,5090上跑一次要三四个小时,走的是接近训练那种量化流程。