聊个感受:从最早那波文生视频到现在国内外一堆模型接连亮相,视频 AI 热闹是真热闹,但那种一出来就让所有人意识到范式变了的 GPT 时刻,好像还没到。
分几点说。一是可控性还差口气,出几秒惊艳片段不难,难的是稳定按分镜、按连续动作出你要的东西,随机性太大;二是一致性,同一个角色、同一个场景跨镜头保持住依然费劲;三是从能出片到能进真实生产流程,中间那段体验断层还很明显,多数时候还是抽卡。
倒不是唱衰,图像那边这两年的跃迁就是先热闹再收敛的路子,视频大概率也这么走。只是现在这个阶段,惊艳的demo和真能干活之间的鸿沟,得诚实承认。