从工程师视角聊聊,AI画图现在最难啃的几块骨头

本职写后端,业余玩AI出图小半年,越玩越好奇底层难在哪,就顺手查了些资料,也结合自己踩的坑说说。最直观的难点是手,多指少指是老毛病,本质是模型对局部结构和物理约束理解不够。

第二个是长文本一致性,你想让同一个角色在不同图里保持长相,光靠提示词很难稳,得靠额外手段固定。第三个是文字,图里想生成一段清晰的中文标题,十有八九糊成乱码,这块进步一直慢。

第四个是可控性,你脑子里的构图和它给的结果经常对不上,得反复试。这几点里我觉得一致性和可控性最影响实际生产,纯好看已经不难了,难的是稳定听话。你们实操里最头疼哪个?

手现在好很多了,反而中文文字这块是真顽固,试了无数次全是鬼画符。

一致性最要命,做角色的最懂,同一个人换个场景就变脸。

可控性这条我举双手,脑子里想的和出来的经常两回事。

码住

商业出图最烦的就是文字,想放个slogan直接糊,只能后期自己补。

1 个赞

工程视角这个切入挺有意思,平时只顾着抽图,没想过底层 :thinking:

中文这块确实没救,我现在一律留白后期上字,不跟模型较劲了

一致性这条最要命,做系列图的都懂,换个场景脸就得重新对一遍