阿里的Wan2.7出来了,从透出的信息看,这版发力的地方在口型和音色复刻。
剪片子的人应该都懂口型这个执念从哪来。观众对画面瑕疵的容忍度其实不低,多一根手指、背景糊一块,很多人根本注意不到。但嘴型和说话对不上,哪怕差半拍,那种诡异感是本能级别的,一眼就出戏。这道坎迈不过去,视频模型就只能干无对白的空镜。
音色复刻这块我态度复杂。工具上讲当然爽,一个人能顶一个配音组。但这东西的滥用门槛太低了,声音这种东西比脸还容易被拿去干坏事,现在的辨识手段基本跟不上。
技术这边一年一大步,规矩那边还在原地打转。