刚看到 Flux3 发布,最抓眼的是原生音频生成,能做到 20 秒的音视频同步输出。以前生成视频和配音基本是两条线,画面出完再单独配声,对口型对节奏累死人。原生就把音频一起生成出来,理论上画面和声音天然是一套的,不用后期硬凑,这个思路对做短片和分镜预演的太友好了。
20 秒的时长现在看还是片段级别,但同步这件事本身比时长更有价值,一段能对上,拼起来就有戏。
多模态一起生成对模型的要求高很多,音画要在语义和时间轴上都咬合。具体音频质量、能不能控制音色和情绪这些还得看到实际样例才知道,光一个同步概念不够。