趁着手头训 SDXL 微调,顺手把文生图这几年的路捋了一遍,挺感慨。早期那批模型出的图,构图崩、手指乱、文字全是鬼画符,能认出主体就算成功,更多是当技术演示看。后来分辨率、构图、细节一代代往上补,提示词理解越来越到位,复杂场景不容易丢元素了,画面里的文字也慢慢能读了。
到能在自己的图上做微调、训 LoRA 固定画风这一步,才算真正能进创作者的日常工作流,而不只是玩具。回头看,进步最快的其实是「可控性」——从纯抽卡碰运气,到能指定风格、指定角色、指定版式。
技术迭代是一方面,更关键是这套工具从实验室慢慢变成了普通人也能上手的东西。下一步大家最盼的还是可控和一致性再稳一点。