30 系上 FP8 反而更慢,这版 W4A4 才算对症

20/30 系没有 FP8 张量核,网上那套「先转 FP8」的通用建议在这些卡上经常还不如直接 BF16,这个坑不少人一直没绕过去。Krea 2 Turbo 有个 W4A4 的量化就是奔着这类卡去的:激活感知的 INT4 加一条低秩修正分支,不需要校准数据集,体积大概是常见 FP8 版的三分之一。

3090 上 1024 出图、8 步、热启动的数字很直白,BF16 十八秒八,纯 W4A4 六秒五接近三倍,挂上低秩分支之后七秒多,也还有两倍四到两倍六。

那条修正分支大概吃掉一成的单步时间,而且 rank 从 16 拉到 256 只慢 4%,精度基本是白送的。

最有意思的是激活感知那一项:按真实的逐通道能量去拟合分支,而不是假设它均匀,推理时形状和 kernel 全没变,只是分支里的数不一样,精度收益却是整个项目里最大的一块。

3090 党看乐了,之前照着 FP8 那套折腾半天,全是无用功

低秩分支才吃一成时间,那 rank 干脆拉满算了