视频生成不会出现“DeepSeek时刻”——这个判断我基本认同。文本模型能靠一个巧思把成本打下来,是因为它本质在处理离散token,蒸馏和架构优化的空间大。
视频不一样,时间维度上的连贯、物理运动的合理、多帧一致,光是数据和算力的门槛就摆在那,不是换个训练技巧就能一夜追平。做分镜最能体会这点,静态一张图惊艳很容易,让镜头连续运动十几秒还不穿帮、不变形,才是真难点。
所以我不太指望突然冒出个又便宜又强的开源视频模型把格局掀了,更可能是一线几家慢慢磨。
视频生成不会出现“DeepSeek时刻”——这个判断我基本认同。文本模型能靠一个巧思把成本打下来,是因为它本质在处理离散token,蒸馏和架构优化的空间大。
视频不一样,时间维度上的连贯、物理运动的合理、多帧一致,光是数据和算力的门槛就摆在那,不是换个训练技巧就能一夜追平。做分镜最能体会这点,静态一张图惊艳很容易,让镜头连续运动十几秒还不穿帮、不变形,才是真难点。
所以我不太指望突然冒出个又便宜又强的开源视频模型把格局掀了,更可能是一线几家慢慢磨。
认同,视频和文本的门槛根本不是一个量级
蹲一个反对意见