AI 视频最劝退的从来不是画质,是每段的声音都不像同一个人,角色走着走着脸也变了。animated-voiceover 这套开源流程的解法很工程:先跑第一段,把人声提取成一条固定的高采样率参考音频,后面所有片段全挂这同一条参考;风格用一张图贯穿全片,每个角色单独一张参考图加一份角色表;旁白先整篇写完再切,中文卡到每 15 秒 60 个字,每 15 秒拆 5 个镜头,主体、变化、运镜都写清楚,再逐段过 QC,不合格就重跑。
它不是软件也不是 App,是一整套喂给命令行 Agent 的制片流程,MIT 协议。
作者自己算下来两分钟的片子成本大概四十块。真正决定上限的还是选题和审稿那部分,重复的、熬人的环节确实可以扔出去。