先把配音锁死再往下跑,AI 动画最烦的一半问题就没了

AI 视频最劝退的从来不是画质,是每段的声音都不像同一个人,角色走着走着脸也变了。animated-voiceover 这套开源流程的解法很工程:先跑第一段,把人声提取成一条固定的高采样率参考音频,后面所有片段全挂这同一条参考;风格用一张图贯穿全片,每个角色单独一张参考图加一份角色表;旁白先整篇写完再切,中文卡到每 15 秒 60 个字,每 15 秒拆 5 个镜头,主体、变化、运镜都写清楚,再逐段过 QC,不合格就重跑。

它不是软件也不是 App,是一整套喂给命令行 Agent 的制片流程,MIT 协议。

作者自己算下来两分钟的片子成本大概四十块。真正决定上限的还是选题和审稿那部分,重复的、熬人的环节确实可以扔出去。

锁人声参考这招好,之前每段声音都像换了个人,最后只能全片自己配

谢佬 :pray:

每 15 秒 60 字听着死板,但读下来节奏是真的稳

四十块一条要是实测能对上,产量就能拉起来了

1 个赞

声音先定死这个顺序是对的,反过来就是让嘴型去迁就声音,越改越乱。

四十块是纯出片的钱还是含返修?改一轮的成本才是大头