Luma的Uni-1上了ComfyUI Partner Nodes。跟大多数图像模型不一样,它不是扩散模型,而是个decoder-only的自回归transformer,把文字和图像当成同一条交错的序列来处理,在一个架构里同时建模时间、空间和逻辑。
对我做产品的人来说,最值得琢磨的是它的工作方式:先推理再生成。别的模型基本是prompt直接到像素一步到位,Uni-1会先把指令拆解、把里面难缠的地方(要几个、什么放哪、有没有逻辑条件)理清楚、把构图规划好,然后才落笔,有点像前沿LLM在做规划。
官方列的能力里几个挺实用:材质准确的写实、真能读得清的文字渲染、带身份保持的参考生成、图像编辑和多轮细化、带时间一致性的多格输出,还有联网检索接地和多语言提示词。输出支持9种比例,从超宽横幅到超高竖版都有。上手还是老一套,更新ComfyUI、节点库里找Luma UNI-1 Image节点或载模板,编辑的话再丢张图进去。