本地 notebook 里跑得好好的 prompt,一上生产编排层就崩,这几乎是常态。我这两年踩下来,故障很少出在生成器本身,多半藏在各阶段的交接处。文本编码器一换成蒸馏版,内存是省了,罕见 token 的对齐频率就明显飘;从 pixel 挪到 latent 空间省了一个数量级算力,可高 guidance 下压缩伪影会跟 CFG 打架,脸和字先崩的就是它。
KV cache 复用把吞吐拉上去,一旦 prompt 超出显存窗口,缓存驱逐策略又带来玄学般的非确定性。
长 prompt 前面那段语境为什么会"消失",本质就是调度器把最早进来的 token 当成最少用的信息给踢了。真要定位,我现在习惯把注意力热图和最终图一起存档,attention drift 基本是最靠前的预警信号。
选模型别只盯样本质量,能不能干净地换 sampler、缓存、挂后置过滤器,才决定你维护起来累不累。