本职写后端,业余玩AI出图小半年,越玩越好奇底层难在哪,就顺手查了些资料,也结合自己踩的坑说说。最直观的难点是手,多指少指是老毛病,本质是模型对局部结构和物理约束理解不够。
第二个是长文本一致性,你想让同一个角色在不同图里保持长相,光靠提示词很难稳,得靠额外手段固定。第三个是文字,图里想生成一段清晰的中文标题,十有八九糊成乱码,这块进步一直慢。
第四个是可控性,你脑子里的构图和它给的结果经常对不上,得反复试。这几点里我觉得一致性和可控性最影响实际生产,纯好看已经不难了,难的是稳定听话。你们实操里最头疼哪个?