翻了下这个把Krea2做成INT4的量化版,思路是4bit整数权重再叠一层group-wise的Hadamard旋转(所谓ConvRot),靠旋转把离群值摊平,掉点比裸4bit小不少。
它把Raw和Turbo都转了:Raw是没蒸馏的底模,输出更活、适合拿来训LoRA和微调;Turbo是8步蒸馏版,图快,而且在Raw上训好的LoRA能直接迁过去出图。
作者说在3060 12G上跑得动,SM8.0以上的卡都行。12G能塞下这种底模确实香,就是得配对应的ConvRot加载节点,普通loader读不了,这点要留意。