文生视频搞到现在也没个所谓的 aha moment,是真难还是根本没找对路

总有人拿文生视频跟文本大模型比,说人家早有了那个让人拍桌子的瞬间,视频这边怎么还挤牙膏。我倒觉得这两个东西不好硬套。文字对错一眼能判,视频错在哪你得逐帧盯,评估本身就是个大坑,反馈信号又慢又贵。

再说观众的阈值高得离谱,人对运动的不自然天生敏感,脸稍微飘一下、手多一根指头立马出戏,这种容错空间跟聊天机器人完全不是一个量级。

与其等某个惊天时刻,不如老老实实先把物理一致性和时长稳定性磨上去。