生图这波往流匹配走,单模型同吃文本和图像输入

生图这边架构上在起变化,流匹配这类路线正在替代一些传统做法,而且开始出现一个模型同时吃文本和图像输入的设计。对我们做底层的来说,流匹配相比多步去噪,训练目标更直、采样路径更短,工程上部署和加速的空间明显更大。

真正有意思的是文本图像统一进同一个入口,意味着编辑、参考图、条件控制不用再各搭一套分支,架构能收敛不少。

当然收敛之后对显存和批处理调度的要求也会变,落地时这块得重新算账。挺想扒一下具体是怎么把两种模态对齐喂进去的。

流匹配采样路径短这点确实香

单模型同吃文本和图这方向早晚成主流,省掉一堆胶水和中间格式转换,做底层的最烦对齐两套输入