拿 Seedance 2.0 重搭了短片预演流程,四人活儿变成一个脚本

上周花了三个下午把一个短片的 pre-vis 流程围着一个 API 端点重搭了一遍,剧本、导演笔记、镜头单都没变。结果原本要一个四人分镜团队、一个初级 3D 做粗排、外加一周改稿的活儿,塌缩成了一个 Python 脚本。

Seedance 2.0 是 ByteDance 今年二月发的多模态视频模型,时长 4 到 15 秒,分辨率 480p 到 1080p,支持七种画幅还能出原生音频。它加了个 omni-reference:首帧、尾帧、角色/风格/运动的参考图,甚至参考音频都能喂。我实测它角色和场景一致性比我用过的开源模型稳很多,一次调用回来的是带声音能看的一段,不是还得配乐的哑片。

我最有感的是预演这块,「90% 工作量」的说法在这儿是真成立。以前粗排一个镜头要初级美术在引擎里排两三天再改一两轮,现在几分钟出一版,够导演、摄影、制片开会吵「这镜头值不值得拍」了——而那个会才是工作室真正在付钱买的东西。批量短视频那条我是排队跑的:周一写一堆 prompt 进 CSV,脚本挨个跑一晚上,周三挑成片。有两个坑记一下:时长是固定枚举值(4/5/6/8/10/12/15),别在文案里承诺 7 秒 9 秒;音频描述写抽象点,「背景环境音乐」这种,别写「手表滴答」这类精确拟音,出不来。另外首帧和参考图不让放真人脸,插画、风景、产品图或 AI 生成的无人图才行。

预演这块我信,粗排最耗人还最不出彩,能几分钟出一版够开会用就赢了

坐等实测

固定枚举时长这个坑,我上次就是承诺了7秒被打脸

回楼上,就这个,文档里写死的enum,客户端别自己脑补中间值