分区框选提示词加多角色 LoRA 不串味,这个思路值得抄

多角色同框最烦的就是 LoRA 串味,A 的脸长到 B 身上。有套做法是在画布上直接拉框,每个框写自己的内容提示词和角色提示词,另外留一条全局提示词专管风格和光线。关键在注意力权限:框内的图像 token 只能访问本框的文本 token,框外的文本也进不来,但图像 token 之间不做限制,否则边界会留下明显的矩形接缝。

LoRA 那边不融权重,按区域把区域外的 delta 直接归零,带全局 K/V 投影的那类干脆跳过、只留 Q 的增量。

边界强度还能按去噪步数衰减,前几步压死、后面放开让全局注意力去缝合。它不是完全可控的,模型在框里还是会自己发挥,但比事后一块块 inpaint 省事太多。

牛啊 :fire:

图像 token 不设限这个处理很聪明,我之前上硬掩码边界全是直角

多角色串味真是老大难,以前只能一个个画完再合成