总有人拿文生视频跟文本大模型比,说人家早有了那个让人拍桌子的瞬间,视频这边怎么还挤牙膏。我倒觉得这两个东西不好硬套。文字对错一眼能判,视频错在哪你得逐帧盯,评估本身就是个大坑,反馈信号又慢又贵。
再说观众的阈值高得离谱,人对运动的不自然天生敏感,脸稍微飘一下、手多一根指头立马出戏,这种容错空间跟聊天机器人完全不是一个量级。
与其等某个惊天时刻,不如老老实实先把物理一致性和时长稳定性磨上去。
总有人拿文生视频跟文本大模型比,说人家早有了那个让人拍桌子的瞬间,视频这边怎么还挤牙膏。我倒觉得这两个东西不好硬套。文字对错一眼能判,视频错在哪你得逐帧盯,评估本身就是个大坑,反馈信号又慢又贵。
再说观众的阈值高得离谱,人对运动的不自然天生敏感,脸稍微飘一下、手多一根指头立马出戏,这种容错空间跟聊天机器人完全不是一个量级。
与其等某个惊天时刻,不如老老实实先把物理一致性和时长稳定性磨上去。