生数把 Vidu 更新到 Q3 了,这次强调的是音画同步,一次能出到 16 秒的带声音片段。对我们做短视频的来说,最烦的就是画面生成完还得单独配音、对口型、卡节奏,如果模型能把这一步一起吃掉,那省下来的时间是实打实的。
当然 16 秒这个长度放到成片里还是得靠拼,单条镜头够用了。声音这块具体是环境音、配乐还是能跟人物动作对上,官方说法我还没细看,等有人上手放几段原生成的例子再判断。
生数之前那几版在运动幅度上一直算稳的一档,这回加了音频维度,就看实际出来的声画贴不贴。
生数把 Vidu 更新到 Q3 了,这次强调的是音画同步,一次能出到 16 秒的带声音片段。对我们做短视频的来说,最烦的就是画面生成完还得单独配音、对口型、卡节奏,如果模型能把这一步一起吃掉,那省下来的时间是实打实的。
当然 16 秒这个长度放到成片里还是得靠拼,单条镜头够用了。声音这块具体是环境音、配乐还是能跟人物动作对上,官方说法我还没细看,等有人上手放几段原生成的例子再判断。
生数之前那几版在运动幅度上一直算稳的一档,这回加了音频维度,就看实际出来的声画贴不贴。
蹲一个实测
16秒够剪一个卡点了
音画同步这块是真痛点,光对口型就能磨半天
先看有没有中文语音支持吧,不然对我用处不大
顶,做视频的都懂配音多烦
生数运动幅度确实一直挺稳的
坐等放原声demo,光文字吹没用
这个才是重点,之前用某家生成一段中文,英文腔调尬到脚趾抠地