黑森林这次动作不小,Flux3 是往多模态方向走,标出来的能力是原生音视频同步生成,一次二十秒。以前要一段带声的分镜预演,流程是画面归画面、声音归声音,最后进剪辑软件对轴,口型和脚步声这类细节基本靠手动怼。
如果画面和音轨是同一个模型一次吐出来的,理论上对轴这一步能省掉,这对预演阶段的意义比单纯画质提升大得多。
二十秒也不算短,一个完整的镜头组塞得下。当然“原生同步”四个字听着好听,实际口型准不准、环境音会不会糊成一团背景噪音,还得等真上手的人反馈。
黑森林这次动作不小,Flux3 是往多模态方向走,标出来的能力是原生音视频同步生成,一次二十秒。以前要一段带声的分镜预演,流程是画面归画面、声音归声音,最后进剪辑软件对轴,口型和脚步声这类细节基本靠手动怼。
如果画面和音轨是同一个模型一次吐出来的,理论上对轴这一步能省掉,这对预演阶段的意义比单纯画质提升大得多。
二十秒也不算短,一个完整的镜头组塞得下。当然“原生同步”四个字听着好听,实际口型准不准、环境音会不会糊成一团背景噪音,还得等真上手的人反馈。
先码住
对轴这事是真耗时间,能省一步是一步