智象未来放出来的HiDream,定位写的是交互式世界模型,不是单纯的文生图或者文生视频。这两件事差别不小:后者你丢个提示词拿结果就完事,前者得维持一个能被持续操作的状态,输入进去要有响应,画面还得前后自洽。
真正难的从来不是第一帧多惊艳,而是几十步之后场景会不会崩、东西会不会凭空消失、走回头路能不能对上。
国内做这块的团队一下多起来,说明大家都判断下一个卡位在这儿。至于实际能玩到什么程度,得看放出来的是能实时跑的东西,还是录好的一段片子。
智象未来放出来的HiDream,定位写的是交互式世界模型,不是单纯的文生图或者文生视频。这两件事差别不小:后者你丢个提示词拿结果就完事,前者得维持一个能被持续操作的状态,输入进去要有响应,画面还得前后自洽。
真正难的从来不是第一帧多惊艳,而是几十步之后场景会不会崩、东西会不会凭空消失、走回头路能不能对上。
国内做这块的团队一下多起来,说明大家都判断下一个卡位在这儿。至于实际能玩到什么程度,得看放出来的是能实时跑的东西,还是录好的一段片子。
世界模型现在什么都往里套,能不能维持状态才是分水岭