生数科技把Vidu S1实时交互模型正式发上线了。最抓我眼球的是它主打实时可交互,能实时视频通话,还能用语音去控制视频往哪个方向走,这思路跟以前那种输入提示词等它慢慢渲染完全是两码事。
参数上官方给的是支持540P(960x540)、25FPS,最高能到42FPS,初始形象可以是真人、动漫也可以是萌宠,音色还能个性化,等于快速捏一个专属的交互角色出来。
我是做短视频的,第一反应是这玩意儿要是真能语音实时带节奏,做虚拟主播和互动角色会省一大截功夫。就是不知道实际延迟和口型对得齐不齐,有上手了的说说?