一张照片几秒钟生成能对话的角色,实时数字人这条线快跑通了

实时交互这块最难的从来不是画得像,是接得上。Characters 这套是丢一张照片进去,几秒钟生成一个能直接对话的角色,不用再单独微调,写实还是插画风都能吃,画面逐帧往外吐,所以能撑住半小时以上的连续对话——这个时长在做互动内容的人眼里比分辨率重要多了。

它三月份就上线了,这回能进 Real-Time Live! 环节,至少说明是现场当场跑通的,不是剪出来的片。

团队后面提到的方向是可导航环境、多张参考图和记忆,前两个真落地基本等于一个能走进去的虚拟演员棚,记忆那条最难,也最决定它是玩具还是工具。我更关心延迟曲线,聊到二十分钟往后还稳不稳。

30 分钟不崩比画质更值钱,长镜头最怕聊着聊着换了张脸

长时间不崩确实才是硬指标,脸一漂观感立刻就塌了

一张照片就能对话听着很爽,实际卡点多半在延迟,接得上不等于接得快。