端到端联合训练分词器和自回归,ImageNet 256 FID 1.48

ICML这批spotlight里,端到端做图像生成这个方向挺值得说。老范式是先训分词器把图压成token、再单独训自回归模型,两步各管各的,分词器只顾重建、未必适配下游生成。

这套做法把重建和生成放进同一个框架联合优化,让生成端的梯度能一路回传到编码端,逼着分词器学到更适合生成的表示,还拉了视觉基础模型来加强语义。

结果在ImageNet 256无条件生成上做到FID 1.48,是无引导条件下的当前最优。分词器和生成模型不再各自为政,这个思路后面大概会被跟。

FID 1.48这个数字确实唬人

端到端联合训练看着就是趋势

两阶段那个分词器早就是瓶颈,该联合优化了

1 个赞