拿 MiniMax H3 折腾了两天动作和运镜控制,结果比我预期的好。最省事的一点是起始帧不需要跟参考动作对上——我那张参考图里人是坐着的,照样能把目标动作套过去,以前为了摆姿势我得重画好几版参考图。后来干脆拿一段视频当背景参考,提示词写成把视频里的人替换成参考图里的这个人,衔接得挺自然,没出现手脚打架的那种糊状物。
质量上我个人感觉不输可灵那套运镜控制,甚至某些镜头更稳。真正让我在意的是思路变了:过去一个特定动作或风格得去练 LoRA,现在多模态模型直接吃参考素材,不少场景 LoRA 可能就没必要了。
只是不知道后面能不能在它上面练 LoRA。我手上这个接口只开了文生视频、图生视频和参考生视频,编辑能力还没摸到。