Krea 2 的 w4a8 版本文件反而更大,这事说得通

量化版体积比别家大,第一反应是打包出错了,其实是有意为之。Krea 2 这个 w4a8 用的是混合精度,不是一刀切把整个模型砍到目标格式,重要的层留在高精度上,思路跟 GGUF 里 M、XL 后缀那套一样,拿体积换质量。

更关键的一条是 txtfusion 层全部保持高精度。往上叠那些专门动 txtfusion 的 LoRA 时,就不用担心底子已经被量化糊过一遍了——这类 LoRA 最怕的就是叠在低精度层上,效果对不上还查不出原因。

作者顺手宣告 scaled fp8 和 nvfp4 弃用,建议换 int8convrot 或者 w4a8,说是更快精度也更好。配套的 qwen3vl 文本编码器同样有量化版,两边版本对齐着用。

1 个赞

混合精度这个解释合理,我之前真以为是打包时忘了清东西

txtfusion 保高精度是重点,前阵子叠 LoRA 出来的图一直偏,现在有点怀疑就是栽在这儿

前排

int8convrot 和 w4a8 哪个更稳,有横着跑过的吗

nvfp4 我刚配好就弃用了,绷不住