LTX-2.5 的多镜头,总算不用生成完再一张张对脸了

接分镜的活最烦的就是一条片子几个镜头对不上,同一个人换个机位就变脸,灯光也飘。LTX-2.5 把多镜头做进了单次生成,一次出来几个相连的镜头,人物、场景、光线、风格是连着的,不用生成完再一个个对色对脸。渲染思路也改了,不再把算力平摊到整个画面,先在压缩的潜空间里把运动、构图、机位定下来,配一组关键帧,复杂的镜头多给几张、简单的少给,最后交给一个像素扩散阶段渲成片。

解码器换掉了原来的 VAE,快速运动下的糊边和文字可读性应该会好些。

开源权重还是能下,dev 和蒸馏版都有。ComfyUI 升到 0.32.0 就能在模板面板里找到 T2V、I2V 和首尾帧三套。我最想试的反而是那个实验性的时长预测,让模型自己判断这条该多长。

蹲后续

多镜头一致性是真痛点,之前拼四个镜头对色对到怀疑人生