做产品这两年一直在盯AI视频,早期全在卷分辨率、卷帧率、卷谁的画面更炫。真上手就发现,画面漂亮但镜头之间不连贯、物理不对、人物前后对不上,落地根本没法用。
现在风向明显往理解这边转——模型得看懂你要讲什么,而不只是渲染好看的像素。对做产品的来说这是好事,理解力上去了才谈得上真正的生产工具,而不是出个demo惊艳一下。
谁先把连贯性和可控性做扎实,谁才有机会吃到商业化那口饭。
做产品这两年一直在盯AI视频,早期全在卷分辨率、卷帧率、卷谁的画面更炫。真上手就发现,画面漂亮但镜头之间不连贯、物理不对、人物前后对不上,落地根本没法用。
现在风向明显往理解这边转——模型得看懂你要讲什么,而不只是渲染好看的像素。对做产品的来说这是好事,理解力上去了才谈得上真正的生产工具,而不是出个demo惊艳一下。
谁先把连贯性和可控性做扎实,谁才有机会吃到商业化那口饭。
可控性才是命根子
confirm 画质早够用了
物理不对这点太致命
顶这个观点
理解力上去成本是不是也上天
+1
画质早卷够了,下半场拼理解这判断我认同,就怕可控性堆上去推理成本又翻几番,个人用户还是肉疼。
可控性上去推理成本翻几番这担心很现实,个人用户到头来还是被算力卡住
物理穿模是真劝退,做个倒水的动作水能穿杯子,客户一眼就看穿