记个坑。用 GGUF 版的 LTX 2.3,本以为量化过就轻松了,结果加载阶段内存直接顶穿,显卡那边一点动静都没有,特别容易误判成显存不够。原因是 GGUF 里只装了 transformer 那些块,VAE、声码器、各种连接层还得从原始那份 bf16 完整权重里取,而加载器会把整个文件在系统内存里实打实展开一份,峰值奔着六十个 G 去。
解法是把真正需要的那几块单独切出来配着用,切完九个 G 出头,峰值掉到十一二个 G,出图结果一模一样,因为压根没做二次量化。
内存不够的先别急着加条子,先看是不是这个问题。