FLUX 3 一次能出 20 秒视频,还自带声音

FLUX 3 现在是 Early Access 阶段。看架构说明,是把图像、视频、音频放进一个统一模型里联合学,基于 Self-Flow 那套学习框架往外扩的,支持文生视频、图生视频、多镜头串联这些任务。

对做剪辑的来说,最实在的一条是单次能出到 20 秒,而且带原生音频。以前拼一条一分钟的片子,四五秒一段慢慢接,接缝、光比、人物长相全靠后期硬圆过去。20 秒意味着一个完整场景能一口气跑完,多镜头串联那条要是真稳,分镜就能落到模型里而不是只存在我脑子里。音画同源这点更关键,配音和口型不用再单独对一遍。

至于 Early Access 排不排得上队,那是另一回事了。