最近在琢磨用AI数字人做音乐视频这套流程,市面上主流的数字人模型试了两个下来,感受还挺不一样。核心的痛点其实一直是口型对齐和表情自然度,画面再好看,嘴对不上音乐节奏就一秒出戏。
一站式的工具好处是省心,把生成、驱动、合成串到一条线上,不用在几个软件之间来回导素材。但也有代价,越是打包好的流程,可调的细节就越少,想抠某一帧的表情就没那么灵活。
对追求效率的人来说够用,对较真的人可能还得回到分步工作流。做几条短视频试水完全没问题,商用出片就得看具体项目要求了。
最近在琢磨用AI数字人做音乐视频这套流程,市面上主流的数字人模型试了两个下来,感受还挺不一样。核心的痛点其实一直是口型对齐和表情自然度,画面再好看,嘴对不上音乐节奏就一秒出戏。
一站式的工具好处是省心,把生成、驱动、合成串到一条线上,不用在几个软件之间来回导素材。但也有代价,越是打包好的流程,可调的细节就越少,想抠某一帧的表情就没那么灵活。
对追求效率的人来说够用,对较真的人可能还得回到分步工作流。做几条短视频试水完全没问题,商用出片就得看具体项目要求了。
口型对齐是老大难,嘴对不上真的一秒出戏
一站式省心但可调细节少,这个取舍说到点子上了
求问哪两个模型啊,想跟着试试
表情自然度这块现在整体还是差口气
同求型号,口型这块现在整体还是差口气,嘴对不上再好的画面也一秒出戏