阿里视频生成模型加了语音驱动,数字人这块又近一步

阿里的视频生成模型这次升级支持语音驱动了,意思是给一段音频,人物的口型、表情能跟着声音动起来,做数字人口播、虚拟主播这类内容门槛又降了一截。以前想让画面里的人「说话说得像」,要么绿幕拍要么专门的对口型工具,现在生成阶段就能带上,省了一道后期。

对做短视频、口播号的人是实打实的效率提升,尤其是不想真人出镜的场景。口型贴合度、表情自然度这些还得看实际素材跑出来的效果,官方演示一贯是挑最好的放。

语言、口音的适配范围也得试过才知道边界在哪。方向上生成式视频从「动起来」到「说得像」这一步跨得挺关键。

口播号不想露脸的有救了

口型贴合度是关键,差一点就出戏

中文口型准不准啊,很多工具都是英文优先

数字人这块今年进步是真快

1 个赞

省了对口型的后期,这个提效很实在

表情自然度才是难点,动是能动