ControlNet真正解决的不是画得好不好,是构图和姿态能不能听话。
扩散模型出细节是真惊艳。可只靠提示词去指挥它把人摆在哪、摆什么姿势,基本就是碰运气,多抽几张看哪张顺眼。这也是我觉得它最别扭的地方——什么都能画,但你说了不算。
ControlNet的做法很直给。你先扔一张简单的条件图进去,可以是黑白的轮廓线,也可以是语义分割出来的色块图,它就照着这个骨架把画面往外长。这样一拆,分工就清楚了:细节长什么样,交给模型;东西摆哪、什么姿态,这部分权力从提示词手里收回来,由你那张条件图说了算。提示词照写,只是不再管“摆位置”了。
为什么我把这个叫可用性的分水岭,而不是又一个好玩的功能?因为构图从随缘变成了可复现。同一张条件图,你换风格、换提示词、换种子,人还在那个位置、还是那个姿势。做东西的人最怕的就是这次出来了下次出不来,这一点解决了,后面很多流程才搭得起来。
想问下大家,线稿和分割图混着当条件一起用的时候,两边权重一般怎么配比较稳?我自己还没摸到一个顺手的比例。