混元生图3.0 这次的路线值得单独说一句。
主流 DiT 的做法是把语言模型当文本编码器用,负责把 prompt 翻成向量,剩下的活全交给扩散主干,语言能力其实被砍掉了大半。混元3.0 反过来,把 LLM 放到底座位置,预训练阶段就把语言数据、多模态理解和多模态生成混着喂,让理解那一侧去反哺生成。
这条路吃亏在成本和调参,数据配比稍微歪一点两边一起拉胯;好处是长指令、多主体关系、画面里的逻辑约束这类东西天然更扛得住,不用靠一堆改写 prompt 的外挂去补。
架构讲得再顺也只是个前提,最后还是看手上跑出来的图。