音视频一起出这件事,对口播的影响比我原先估的大。以前一条口播得先出画面再回头对口型,中间那道工序又慢又容易穿帮,现在模型把声音和画面一并吐出来,链路直接短一截。Minimax 的 H3 有能本地跑的版本,短剧那边先动起来了,看架势是奔着量产去的。
口播现在大致就四条路:不露脸;嘴唇模型,分本地和线上;专属数字人模型;再就是直接上视频生成模型。前三条都算成熟,第四条一直卡在人物一致性上。音视频同出之后我准备把最后这块补上,看多段接下来人还撑不撑得住。
音视频一起出这件事,对口播的影响比我原先估的大。以前一条口播得先出画面再回头对口型,中间那道工序又慢又容易穿帮,现在模型把声音和画面一并吐出来,链路直接短一截。Minimax 的 H3 有能本地跑的版本,短剧那边先动起来了,看架势是奔着量产去的。
口播现在大致就四条路:不露脸;嘴唇模型,分本地和线上;专属数字人模型;再就是直接上视频生成模型。前三条都算成熟,第四条一直卡在人物一致性上。音视频同出之后我准备把最后这块补上,看多段接下来人还撑不撑得住。
音视频同出最大的意义是省掉对口型,光这一步就够换方案了
本地跑对显存要求应该不低吧,有跑起来的说说配置
四条路里现在还是专属数字人模型最稳,视频模型的一致性差口气
这么卷吗 ![]()
口播到最后拼的还是稿子,工序省下来只是让烂稿出得更快 ![]()