Flux3能直接吐出带声音的20秒片段,剪辑这边的工时要重新算了

刚看到黑森林实验室那边把 Flux3 放出来了,最扎眼的不是画面那一栏,是原生音频——能输出 20 秒音画同步的片段。以前这类活是两条流水线:画面生成完,我再去音效库里翻,对不上就一帧一帧挪。现在模型自己把这步吞掉了,哪怕音质只是可用级别,做片头、做氛围垫底也够省事。

我真正关心的是可控性。同步好听,但能不能指定这里要脚步声、那里安静,能不能只重生成音轨而不动画面。要是改一点就得整段重跑,20 秒也不便宜。等能上手了先拿同一段画面连跑几遍,看它给的声音每次飘不飘。