Luma Uni-1的思路不太一样:它不是扩散模型,是先"想"再画

Luma的Uni-1上了ComfyUI Partner Nodes。跟大多数图像模型不一样,它不是扩散模型,而是个decoder-only的自回归transformer,把文字和图像当成同一条交错的序列来处理,在一个架构里同时建模时间、空间和逻辑。

对我做产品的人来说,最值得琢磨的是它的工作方式:先推理再生成。别的模型基本是prompt直接到像素一步到位,Uni-1会先把指令拆解、把里面难缠的地方(要几个、什么放哪、有没有逻辑条件)理清楚、把构图规划好,然后才落笔,有点像前沿LLM在做规划。

官方列的能力里几个挺实用:材质准确的写实、真能读得清的文字渲染、带身份保持的参考生成、图像编辑和多轮细化、带时间一致性的多格输出,还有联网检索接地和多语言提示词。输出支持9种比例,从超宽横幅到超高竖版都有。上手还是老一套,更新ComfyUI、节点库里找Luma UNI-1 Image节点或载模板,编辑的话再丢张图进去。

先推理再画这个方向如果真work,对复杂指令的服从度应该是质变

文字渲染能读得清这条我最在意,做海报老被鬼画符气到

自回归出图速度会不会比扩散慢很多啊 有实测吗

多轮细化+身份保持,这不就是做连续分镜的刚需么

联网检索接地这点有点东西,出图前还能查资料属实没见过

+1 想看它跟Krea 2的风格迁移对打

先想再画这套要真把复杂指令服从度做上去,能省掉一堆反复重抽的功夫

文字能读清这条太重要,做海报老被鬼画符坑

自回归出图一般比扩散慢,但它能边想边查,复杂指令值这点时间

1 个赞