这个版本量化的不只是 UNet,连 qwen_3_06_base 也一起 INT8 了,所以显存占用降得比只量 UNet 的方案狠,文件体积也小一圈。速度上作者给的说法是 20 系及以上开 INT8ConvRot 能有五成以上提速,10 系硬件不支持这条路,只能吃 Turbo 本身的速度。
代价写得也老实:出图会轻微发虚、边缘偏软,于是配了同样 INT8 过的 hdrVAEAnimaKrea2QWN 去补一点画质回来。
我的判断是这类量化包适合两种人,一是显存卡在门槛上根本跑不动新底模的,二是要批量出草图先看构图的。真要交付的成品图,还是回非量化权重稳妥。