FLUX 3 出了,文本图片视频丢进去直接吐带声音的 20 秒片段

刚看到 Black Forest Labs 把 FLUX 3 放出来了,就是做 FLUX 那帮人。这回不是单纯出图模型,是把图像、视频、音频塞进一个统一架构里。最勾人的是 FLUX 3 Video——文本、图片、视频都能当输入,直接生成最长 20 秒、带原生音频的片段,声音是模型自己出的,不用后期再对轨。

除了视频,它也能生成和编辑图像,还支持视频续写、关键帧过渡、多语言对白和排版这些。现在是 early access 阶段,图像那条线 FLUX 3 Image 说是随后开放。

原生音频这块要是真稳,我这种天天在剪辑软件里对口型加环境音的,工作流估计得改一半。先蹲个早期访问看看实际出片怎么样。

带音频了

统一架构这个方向我一直看好,图像视频音频不用来回倒工具,光是省下的对齐时间就值了。