图像生成的两阶段瓶颈要是真被打通,推理成本能省一大截

刚刷到北大和腾讯混元合作的消息,说是把图像生成的"两阶段诅咒"给解了。所谓两阶段,大致就是先生成一个粗糙的中间表示、再靠第二阶段去细化,这中间的信息损耗和误差累积一直是老大难。

具体它们走了什么路子标题里没细说,我也不敢瞎猜跑分。方向上我是认的——单阶段端到端如果真能又快又稳,对推理成本是实打实的利好。

等论文和权重放出来再看能不能复现,画饼谁都会。

蹲论文