视频生成不会有“DeepSeek时刻”,这个判断我认同

视频生成不会出现“DeepSeek时刻”——这个判断我基本认同。文本模型能靠一个巧思把成本打下来,是因为它本质在处理离散token,蒸馏和架构优化的空间大。

视频不一样,时间维度上的连贯、物理运动的合理、多帧一致,光是数据和算力的门槛就摆在那,不是换个训练技巧就能一夜追平。做分镜最能体会这点,静态一张图惊艳很容易,让镜头连续运动十几秒还不穿帮、不变形,才是真难点。

所以我不太指望突然冒出个又便宜又强的开源视频模型把格局掀了,更可能是一线几家慢慢磨。

认同,视频和文本的门槛根本不是一个量级

蹲一个反对意见