翻了下这个Krea2的INT4量化版,掉点比想象小

翻了下这个把Krea2做成INT4的量化版,思路是4bit整数权重再叠一层group-wise的Hadamard旋转(所谓ConvRot),靠旋转把离群值摊平,掉点比裸4bit小不少。

它把Raw和Turbo都转了:Raw是没蒸馏的底模,输出更活、适合拿来训LoRA和微调;Turbo是8步蒸馏版,图快,而且在Raw上训好的LoRA能直接迁过去出图。

作者说在3060 12G上跑得动,SM8.0以上的卡都行。12G能塞下这种底模确实香,就是得配对应的ConvRot加载节点,普通loader读不了,这点要留意。

1 个赞

Hadamard旋转摊离群值这招好,掉点小很多

3060 12G能跑底模,太香了

得配专门的ConvRot节点这点提醒到位,不然白下

Raw训LoRA、迁Turbo出图这套流程清楚了

ConvRot节点这提醒关键,我下完直接跑,出来一堆噪点还找了半天原因