刚看到阿里把视频生成模型升了一版,主打语音驱动。如果口型和语音能真对上,那数字人、讲解视频这类需求就好做多了,以前对口型全靠后期一帧帧抠,费死人。
就是不知道它是只支持中文还是多语种,音色能不能自定义,这些没细说,得等能上手了再判断实际能到什么程度。
语音驱动这个方向国内几家都在追,能落地成产品的话,短视频那批人会很吃这一套。
刚看到阿里把视频生成模型升了一版,主打语音驱动。如果口型和语音能真对上,那数字人、讲解视频这类需求就好做多了,以前对口型全靠后期一帧帧抠,费死人。
就是不知道它是只支持中文还是多语种,音色能不能自定义,这些没细说,得等能上手了再判断实际能到什么程度。
语音驱动这个方向国内几家都在追,能落地成产品的话,短视频那批人会很吃这一套。
蹲一个中文口型效果
数字人赛道又要卷了
语音驱动是刚需,后期抠口型太痛苦了
就怕又是demo好看实际拉胯
+1
音色能不能克隆才是关键 ![]()