不吃图文对,那对齐信号从哪儿来?
LLaDA 这回在文生图上放的东西是两条:全扩散架构,以及预训练不依赖图文配对数据。第一条大家会先看到,我更在意第二条。
文生图这条线从头到尾都是靠图文对撑起来的,对齐就是地基,数据清洗和配对质量基本上把上限先画死了。真能绕开配对预训练,那就等于说对齐信号换了个来源,语言侧和视觉侧在同一个扩散框架里直接打通。这话听着挺顺,但越顺的说法我越想看消融——拿掉哪一块它会塌,塌成什么样,比论文里那几张对比图有用得多。
开源是好事。等我把训练代码从头读一遍再回来说话。
不吃图文对,那对齐信号从哪儿来?
LLaDA 这回在文生图上放的东西是两条:全扩散架构,以及预训练不依赖图文配对数据。第一条大家会先看到,我更在意第二条。
文生图这条线从头到尾都是靠图文对撑起来的,对齐就是地基,数据清洗和配对质量基本上把上限先画死了。真能绕开配对预训练,那就等于说对齐信号换了个来源,语言侧和视觉侧在同一个扩散框架里直接打通。这话听着挺顺,但越顺的说法我越想看消融——拿掉哪一块它会塌,塌成什么样,比论文里那几张对比图有用得多。
开源是好事。等我把训练代码从头读一遍再回来说话。
全扩散这个词现在用得有点滥,得看清楚到底是文本侧也扩散还是只有图像侧
mark
无需图文对我理解更多是不用额外配对语料,底座本身还是见过的,说法上有点取巧
开源文生图阵营终于不是只有那几个在撑了 ![]()
读完记得回来发帖,我这边卡不够跑不动