Flux3 把声音和画面一起生成了,一次 20 秒

黑森林实验室把 Flux3 做成多模态了,最扎眼的一条是原生音视频同步,一次能出 20 秒带声音的片段。以前干这活儿,要么先出画面再配音再对口型,要么后期硬拽时间轴,一条素材来回折腾大半天。

要是生成阶段就把声画对齐了,剪辑这头省下的功夫真不是一星半点。当然 20 秒还是短,接长镜头、同角色多镜头这些估计得再等等。

音质到底什么水平、能不能指定音色,这些都没细说,还得看有人放出实际成品才好判断。

20 秒刚好够一条口播

坐等实测