中文提示词出图对不上,锅多半在文本编码器,不一定是你词写得不好。
之前我一直纳闷:同一个意思,中文写出来老是偏,换成英文反而好使。顺着查下去才明白,很多模型底层用的是英文CLIP,中文进去等于先被硬翻一道,模型再拿翻出来的东西去理解画面。翻译这一步本身就会丢语义,越是带语境的词丢得越狠——你写的和模型“听到”的,已经不是一回事了。
PAI那套思路就比较对路,直接在编码器上动刀:
- 在SD2.1的框架里,把原来的OpenCLIP-ViT/H换成中文CLIP(chinese-clip-vit-huge-patch14)
- 再拿大规模中文图文对重新训
- 整条Pipeline还带了中文CLIP和图像超分
说白了就是让模型从“听”这一步就用中文,不走翻译。
他们还按场景做了定制版:古诗配图、二次元动漫、魔幻现实这几类,古诗配图我觉得最能看出差别。
我做中文向内容,编码器原生吃中文,这点比别的卖点都实在。自己还没认真对比过,最想知道的是长句和抽象词的还原,跟硬翻路线比到底能强多少。实测过的朋友来留点真实反馈吧。