快手可灵这次在CVPR2025把技术布局讲得比较明白,围绕视频生成拉了四条线,其中把世界模型单拎出来当重点方向,信号还挺清楚的。纯做文生视频这条路大家都在挤,能不能让模型真正理解物理、理解时间上的连贯,才是后面拉开差距的地方。
世界模型这个词这两年被说得有点泛,但真要落到视频生成里,涉及的是运动一致性、长时序稳定这些硬骨头。
国产团队愿意把资源往这个更难的方向砸,而不是只堆分辨率和时长,我个人是看好的。具体四个方向怎么协同、哪个先出成果,还得看后续放出来的论文和demo。
快手可灵这次在CVPR2025把技术布局讲得比较明白,围绕视频生成拉了四条线,其中把世界模型单拎出来当重点方向,信号还挺清楚的。纯做文生视频这条路大家都在挤,能不能让模型真正理解物理、理解时间上的连贯,才是后面拉开差距的地方。
世界模型这个词这两年被说得有点泛,但真要落到视频生成里,涉及的是运动一致性、长时序稳定这些硬骨头。
国产团队愿意把资源往这个更难的方向砸,而不是只堆分辨率和时长,我个人是看好的。具体四个方向怎么协同、哪个先出成果,还得看后续放出来的论文和demo。
世界模型这块确实是硬骨头
mark
感觉大厂都在往这个方向卷了,不只可灵一家
世界模型是真硬骨头,短期别指望落地出活,方向押对了而已