清华段岳圻团队有篇工作入选CVPR 2026,核心提法挺有意思:文生图的方法论要从调参数升级到做控制。我理解这个方向其实是行业这两年一直在摸的痛点——大家早就不满足于“出个好看的图”,而是要图里的东西按我说的来,构图、姿态、光照、局部元素能精确拿捏。
以前很多做法本质是在训练和采样上反复调,属于间接影响结果;往“控制”走,是把可控性当成一等公民来设计。
具体方法我没细看原文,不敢瞎解读,等有人扒了论文再聊。但这个转向的判断我是认同的,谁能把可控做扎实,谁就能真正进生产管线。
清华段岳圻团队有篇工作入选CVPR 2026,核心提法挺有意思:文生图的方法论要从调参数升级到做控制。我理解这个方向其实是行业这两年一直在摸的痛点——大家早就不满足于“出个好看的图”,而是要图里的东西按我说的来,构图、姿态、光照、局部元素能精确拿捏。
以前很多做法本质是在训练和采样上反复调,属于间接影响结果;往“控制”走,是把可控性当成一等公民来设计。
具体方法我没细看原文,不敢瞎解读,等有人扒了论文再聊。但这个转向的判断我是认同的,谁能把可控做扎实,谁就能真正进生产管线。
mark,回头找原文
可控性一直是落地卡点,出图好看没用,改一个局部全崩才要命
有arxiv链接吗,想看看具体怎么做控制的
我们最需要的就是这个,同一个角色换动作换视角还能保持住
顶
从调参到做控制这个说法挺准,现在很多时间都耗在反复抽卡上了
每年CVPR都有一堆说要升级方法论的,能不能真进产品还两说
改一个局部整张崩这毛病太致命,可控性上不去,出图再好看也没法交付
改局部整张崩太真实,交付大半时间耗在锁住改好的部分,可控性上去能省一半事