刚上线的Wan2.7我扫了一眼,最抓我眼球的是提到了口型和音色复刻这两块。做短视频的都懂,配音对不上口型是硬伤,观众一眼出戏;如果模型能让人物口型跟着音频走、再把音色也复刻得像,那口播、数字人、二创配音的活儿能省一大截返工。
当然我最担心的还是细节——侧脸、快语速、中英混说的时候口型会不会崩,音色像不像也得听真样本才算数。
功能列表看着挺全,具体能落地到什么程度,还是得等素材出来自己剪一条试试。
刚上线的Wan2.7我扫了一眼,最抓我眼球的是提到了口型和音色复刻这两块。做短视频的都懂,配音对不上口型是硬伤,观众一眼出戏;如果模型能让人物口型跟着音频走、再把音色也复刻得像,那口播、数字人、二创配音的活儿能省一大截返工。
当然我最担心的还是细节——侧脸、快语速、中英混说的时候口型会不会崩,音色像不像也得听真样本才算数。
功能列表看着挺全,具体能落地到什么程度,还是得等素材出来自己剪一条试试。
口型对齐要是真稳,数字人赛道要热闹了
音色复刻这个……又爱又怕 ![]()
快语速下口型最容易崩,蹲实测
做口播的狂喜
mark,回头试试中英混说
确实,配音对不上口型最劝退