一直在等一个能塞进现有流程、又不吃显卡的音频模型,Stable Audio 3.0 这波看着挺对路。它是 Stability AI 新的一家子音乐模型,主打艺术向的折腾,训练数据说是全授权的,商用不慌。
最合我胃口的是分档:Small 的音效和音乐版本能直接跑 CPU,不用大显卡,Small 一档能出到差不多两分钟;想要更长、结构更完整的音乐再上 Medium,有 GPU 的话能拉到六分多钟。对照它之前 Stable Audio Open 那会儿只有十几秒到四十来秒,这跨度是真拉开了。
用法也是老一套:更新 ComfyUI,左边栏模板里 Audio 分类选 Stable Audio 3.0 的模板,本地跑的按说明把模型下好放对目录,写 prompt、设好秒数、点运行。音效、单乐器、氛围、one-shot 采样都能出。我最看重能本地 CPU 出两分钟这条,给画面配个氛围垫乐、给小游戏做点 UI 音效,不用再单开一台机器专门伺候音频。