Flux 3 能出带原生音频的 20 秒视频了

Black Forest Labs 把 Flux 3 放出来了,这回不是只做图,是个能同时从图像、视频、音频里学的多模态底座,最直接的变化是能生成带原生音频、最长二十秒的视频。

对我这行来说,二十秒是个很微妙的长度。以前几秒的片段只能当动态分镜示意,客户看完还得靠我一张嘴解释;二十秒基本能把一个完整镜头、甚至一小段戏交代清楚。带原生音频这点更要紧,环境声和画面是一起生成的,节奏对不对当场就听得出来,不用再临时扒音效垫上去。

同一批还放了个叫 Flux-mimic 的机器人动作模型,看路数是同一套表征往下延伸的。

光看发布说明判断不了可控性,等能上手了再回来说。