上海交大那边发布了一个「世界叙事模型」,明确说了要解决的是AI视频生成「不可控」这个瓶颈。
干我们这行的对「不可控」四个字体会太深了。现在的视频模型你给它一句话,它能给你一段挺好看的画面,但你要它按分镜来——这个镜头人物从左边进,下个镜头接他的近景,脸还得是同一张脸——它就开始自由发挥。所以现在AI视频大多只能当素材或者当氛围片,进不了正经的叙事流程。真正卡住的从来不是画质,是连续性和听话程度。
「叙事」这个词放进模型名里,态度已经摆得很明白了。具体怎么做到的我还没看到细节,也不想凭名字脑补技术路线。要是真能让镜头之间的人物和空间关系稳住,那对做片子的人来说意义比多几个像素大得多。