量化版体积比别家大,第一反应是打包出错了,其实是有意为之。Krea 2 这个 w4a8 用的是混合精度,不是一刀切把整个模型砍到目标格式,重要的层留在高精度上,思路跟 GGUF 里 M、XL 后缀那套一样,拿体积换质量。
更关键的一条是 txtfusion 层全部保持高精度。往上叠那些专门动 txtfusion 的 LoRA 时,就不用担心底子已经被量化糊过一遍了——这类 LoRA 最怕的就是叠在低精度层上,效果对不上还查不出原因。
作者顺手宣告 scaled fp8 和 nvfp4 弃用,建议换 int8convrot 或者 w4a8,说是更快精度也更好。配套的 qwen3vl 文本编码器同样有量化版,两边版本对齐着用。