阿里这版视频生成模型加了语音驱动,口型这块要有戏了

刚看到阿里把视频生成模型升了一版,主打语音驱动。如果口型和语音能真对上,那数字人、讲解视频这类需求就好做多了,以前对口型全靠后期一帧帧抠,费死人。

就是不知道它是只支持中文还是多语种,音色能不能自定义,这些没细说,得等能上手了再判断实际能到什么程度。

语音驱动这个方向国内几家都在追,能落地成产品的话,短视频那批人会很吃这一套。

蹲一个中文口型效果

数字人赛道又要卷了

语音驱动是刚需,后期抠口型太痛苦了

就怕又是demo好看实际拉胯

1 个赞

+1

音色能不能克隆才是关键 :eyes: