生数科技正式发布Vidu S1实时交互模型,能实时视频通话+语音控制走向

生数科技把Vidu S1实时交互模型正式发上线了。最抓我眼球的是它主打实时可交互,能实时视频通话,还能用语音去控制视频往哪个方向走,这思路跟以前那种输入提示词等它慢慢渲染完全是两码事。

参数上官方给的是支持540P(960x540)、25FPS,最高能到42FPS,初始形象可以是真人、动漫也可以是萌宠,音色还能个性化,等于快速捏一个专属的交互角色出来。

我是做短视频的,第一反应是这玩意儿要是真能语音实时带节奏,做虚拟主播和互动角色会省一大截功夫。就是不知道实际延迟和口型对得齐不齐,有上手了的说说?

语音控制视频走向这个点是真新,之前没见谁做实时的

540P 25FPS放今天不算高,但胜在实时,取舍能理解

萌宠形象也能做交互角色,我第一个想到宠物号

关键看延迟,实时通话卡半秒体验就崩了

生数这波节奏挺快的,视频这块卷起来了

虚拟主播要是能语音实时带,成本能砍不少

最高42FPS是特定条件下吧,日常估计还是25