黑森林实验室的 Flux3 出来了,多模态,宣传里最抓我的是首次支持 20 秒原生音视频同步生成。原生同步这四个字对剪辑来说分量很重。以前生成的片段是纯画面,配音配效全靠后面自己贴,一段人物张嘴说话的镜头,口型和声音对不上是常态,对个几十遍就想砸键盘。
如果模型出手的时候声音和画面本来就是一起长出来的,那至少省掉一整轮对轨的活。
20 秒也是个挺微妙的长度,够放一个完整的小情节,做口播、做产品短片刚好卡在能用的线上。就是不知道生成的音频质量到什么水准,环境音、说话声、音乐这几类能不能分开。
黑森林实验室的 Flux3 出来了,多模态,宣传里最抓我的是首次支持 20 秒原生音视频同步生成。原生同步这四个字对剪辑来说分量很重。以前生成的片段是纯画面,配音配效全靠后面自己贴,一段人物张嘴说话的镜头,口型和声音对不上是常态,对个几十遍就想砸键盘。
如果模型出手的时候声音和画面本来就是一起长出来的,那至少省掉一整轮对轨的活。
20 秒也是个挺微妙的长度,够放一个完整的小情节,做口播、做产品短片刚好卡在能用的线上。就是不知道生成的音频质量到什么水准,环境音、说话声、音乐这几类能不能分开。