同样六条提示词,Seedance 2.0 和 HappyHorse 1.0 我对着跑了一遍

字节的 Seedance 2.0 和阿里的 HappyHorse 1.0 这俩视频模型宣传语都快糊成一样了,都带原生音频、都能到 15 秒,光看规格分不出高下。我干脆在 Segmind 上给两边喂完全一样的六条提示词,都按 10 秒、720p、16:9、固定种子 42 生成,十二条片子逐帧对着看、音频并排听,一共花了差不多 19.6 美元额度。

跑下来结论挺清楚:Seedance 强在多镜头叙事和精准还原美术方向,色彩分级、构图、浅景深它跟得最准,角色和场景全程稳,还能关音频、上 21:9 这种宽画幅。HappyHorse 强在对口型和「让提示词里那个动作真的发生」——有条提示词要求手只拿起蓝杯子,Seedance 基本没动,HappyHorse 老老实实把手伸进去把杯子拿走了。它音频也更响更满,直接能丢进时间线。

价格两边都是每条十秒几美元的量级,都在同一个 API 后面,换模型就改一行。要做会说话的数字人、对口型、多语言配音就先上 HappyHorse;要做多镜头短片、卡死美术 look、参考驱动就先上 Seedance。就一次生成一个种子,别当基准测试看,真上生产记得每条多抽两三个变体。

对口型那段太真实了,很多模型嘴都对不上

拿蓝杯子这个测试设计得妙,一下看出谁真听话

mark 收藏对比