阿里的视频生成模型这次升级支持语音驱动了,意思是给一段音频,人物的口型、表情能跟着声音动起来,做数字人口播、虚拟主播这类内容门槛又降了一截。以前想让画面里的人「说话说得像」,要么绿幕拍要么专门的对口型工具,现在生成阶段就能带上,省了一道后期。
对做短视频、口播号的人是实打实的效率提升,尤其是不想真人出镜的场景。口型贴合度、表情自然度这些还得看实际素材跑出来的效果,官方演示一贯是挑最好的放。
语言、口音的适配范围也得试过才知道边界在哪。方向上生成式视频从「动起来」到「说得像」这一步跨得挺关键。
阿里的视频生成模型这次升级支持语音驱动了,意思是给一段音频,人物的口型、表情能跟着声音动起来,做数字人口播、虚拟主播这类内容门槛又降了一截。以前想让画面里的人「说话说得像」,要么绿幕拍要么专门的对口型工具,现在生成阶段就能带上,省了一道后期。
对做短视频、口播号的人是实打实的效率提升,尤其是不想真人出镜的场景。口型贴合度、表情自然度这些还得看实际素材跑出来的效果,官方演示一贯是挑最好的放。
语言、口音的适配范围也得试过才知道边界在哪。方向上生成式视频从「动起来」到「说得像」这一步跨得挺关键。
口播号不想露脸的有救了
口型贴合度是关键,差一点就出戏
中文口型准不准啊,很多工具都是英文优先
数字人这块今年进步是真快
省了对口型的后期,这个提效很实在
表情自然度才是难点,动是能动