Luma这次的Uni-1有点意思,走的是自回归架构,文本和像素同步一起生成,而不是主流那套扩散模型分开搞。自回归做图像最大的看点是能和语言模型一个范式,天然好接多模态上下文,但代价通常是推理速度和高分辨率下的稳定性。
它敢押自回归这条路,说明在采样效率上应该下了不少工程功夫。
文本像素同步这个描述我更好奇是不是指图文交错生成,如果是那想象空间就大了,图里带字这种老大难说不定能顺手解决。
Luma这次的Uni-1有点意思,走的是自回归架构,文本和像素同步一起生成,而不是主流那套扩散模型分开搞。自回归做图像最大的看点是能和语言模型一个范式,天然好接多模态上下文,但代价通常是推理速度和高分辨率下的稳定性。
它敢押自回归这条路,说明在采样效率上应该下了不少工程功夫。
文本像素同步这个描述我更好奇是不是指图文交错生成,如果是那想象空间就大了,图里带字这种老大难说不定能顺手解决。
自回归出图,路子够野
扩散派表示围观
图里带字要真解决了那太香了
速度估计是短板
mark,等技术报告
同步生成文本像素这个说法有点模糊,得看paper
自回归速度是硬伤,一个token一个token吐,真出图恐怕比扩散慢一截,就看它拿质量换不换得回来。