生图这边架构上在起变化,流匹配这类路线正在替代一些传统做法,而且开始出现一个模型同时吃文本和图像输入的设计。对我们做底层的来说,流匹配相比多步去噪,训练目标更直、采样路径更短,工程上部署和加速的空间明显更大。
真正有意思的是文本图像统一进同一个入口,意味着编辑、参考图、条件控制不用再各搭一套分支,架构能收敛不少。
当然收敛之后对显存和批处理调度的要求也会变,落地时这块得重新算账。挺想扒一下具体是怎么把两种模态对齐喂进去的。
生图这边架构上在起变化,流匹配这类路线正在替代一些传统做法,而且开始出现一个模型同时吃文本和图像输入的设计。对我们做底层的来说,流匹配相比多步去噪,训练目标更直、采样路径更短,工程上部署和加速的空间明显更大。
真正有意思的是文本图像统一进同一个入口,意味着编辑、参考图、条件控制不用再各搭一套分支,架构能收敛不少。
当然收敛之后对显存和批处理调度的要求也会变,落地时这块得重新算账。挺想扒一下具体是怎么把两种模态对齐喂进去的。
流匹配采样路径短这点确实香
单模型同吃文本和图这方向早晚成主流,省掉一堆胶水和中间格式转换,做底层的最烦对齐两套输入