口播全流程我一个 CLI 走到底,中间那截还得手搓

数字人主播这套流程我完整拉通跑了一遍,八步,中间没换过软件,全在 codex 里推完的。

先把主播形象图生成出来固定住,这步定了后面每期都能复用;音色用 GeminiTTS、ElevenLabs 这类 TTS 服务先定下来,同样是一次性的事。真正吃时间的是中段:选题调研加快节奏口播文稿,再把文稿拆成视频生成提示词和 B-roll 规划——这步最考验人,拆得糙后面全是废镜头。生成走 FLOVA、即梦这类 CLI 或 API 后端,出来的数字人片段跟录屏、B-roll 一起进 ChatCut,做音频、动效、中英字幕,封装成片。最后补 4:3 和 3:4 的封面,还有标题、简介、标签。

两头都能标准化,中间那截目前还是手工活。

八步里最费时间的确实是选题和文稿,视频那段反而是最快的

全程不切软件这点很关键,来回倒腾最耗心气