文生图大模型这两年变得能用,我觉得靠的是两块进步:对提示词的语义理解更准了,画面结构也更稳了。
早期的毛病大家应该都有印象。给一句话,出来的东西经常牛头不对马嘴,根子在于它对文字理解弱,你写一整句,它只抓住其中几个词;细节也容易糊成一团。
语义理解这块,最直观的是长句和多主体。以前一句话里放两三个角色、各自穿什么做什么,它会把属性安到别人身上,或者干脆漏掉一个。现在长句、多主体没那么容易乱了,写提示词不用再切成一堆碎词去迁就它。
画面结构这块,说的就是手、文字这些老大难。手指、画面里的字,以前基本看运气,现在稳了不少。
阿里这边的文生图模型也在这条线上迭代。至于具体哪一版强到什么地步、跑分多少,我不敢乱报,变化太快,今天记下的数过阵子可能就不作数了。
所以选模型别只看名头。拿自己常画的题材实测一轮最靠谱,别人测得好的场景,未必是你天天画的那类。有横向比过的,说说各自体感。