Step-Video那套模型的技术拆解,做视频生成的可以留意

刷到阶跃星辰有人在讲他们Step-Video系列的关键技术。视频生成比图像难的地方就在时序一致性和算力开销,帧和帧之间怎么保持连贯又不炸显存,是这类模型的核心工程难题。

国内团队愿意把技术细节拿出来讲的不多,能公开分享一些设计取舍,对做底层的还是有参考价值的,起码能看到别人踩过的坑和思路。

等有更详细的技术文档出来再深看一遍。

1 个赞

时序一致性确实是老大难

国内肯讲技术细节的太少了,支持

蹲详细技术文档

显存炸这块太真实了 :sob:

视频生成的工程复杂度比图像高一个量级

+1,做底层的关注下