同样是Qwen edit,这套offload管线怎么比原生慢二十倍

卡住了,来求个思路。

配置先摆清楚:手头就一张 8G 的 4060,本来就在最低要求以下硬撑,内存 96G。

原生那套 Qwen 2511 吃 57G 内存、显存顶到 7G,内存扛得住,速度正常。可换到另一套带 offload 的管线,内存只占 8G、显存 4G,占用是好看了,慢得也离谱,差不多是原生的二十倍。

最玄的是把 sequential offload 关掉直接就 OOM,而 keep in vram 开不开、offload vae、attention slicing 这些开关我一个个全试了,一点区别都没有。这手感不太像单纯配置没调对,更像 offload 逻辑本身有坑。

顺带还有个事:原生做 outpainting,1024x1600 的源图会出伪影,分辨率压低了手指脚趾又开始变形,两头不讨好。

有踩过同款坑的吗,给指条明路?

同问

1 个赞

offload慢是因为一直在往内存倒腾,IO直接卡死

8G卡跑这个本来就极限,不过差二十倍还是不正常。

sequential一关就OOM,说明它全靠这个撑显存