MiniMax Speech 2.6 语音模型更新了

MiniMax 把语音模型更到 2.6 了。做配音、做有声内容的应该会关注这个,语音合成这块这两年进步肉眼可见,从早期一听就是机器的腔调,到现在情感、停顿都能带出来不少。MiniMax 在语音这条线上一直有投入,2.6 应该是又往自然度和表现力上推了一步。

我剪短视频经常要口播配音,请人录成本高又慢,好用的 TTS 能省一大截事。就是不同模型的音色库、多语言支持、还有长文本的稳定性差别挺大的,得实际拿稿子跑一遍才知道趁不趁手。有做播客或者有声书的进来聊聊 2.6 的音色怎么样。

音色库够不够多是关键,翻来覆去几个音听腻了

长文本会不会读着读着串气,这个最影响体验

mark,回头拿口播稿试试

长文本读着读着串气最毁体验,短句还行一长就露馅

长文本读着读着串气最影响体验,跑调了全白搭