OpenAI 的视频模型 Sora 放出了 System Card

刚看到 Sora 的 System Card 出来了。按官方的说法,它是能接文本、图像、视频三种输入,然后生成一段新视频的模型,路子是延续 DALL·E 和 GPT 那套积累下来的。

定位讲得很直白,就是给创作和叙事多一套工具。我比较想聊的是这个多模态输入的设计,文本和图像做条件不新鲜,但把视频也当输入喂进去意味着可以拿现有片段去续、去改,这个交互方式和纯文生视频差别挺大。

System Card 这种东西一般会写它的能力边界和风险控制,做产品集成的应该重点看这块,别只盯着效果炸不炸。有拿到内测的说说实际接视频输入的体验怎么样?

1 个赞

蹲内测反馈

视频当输入去续片段,这个想象空间挺大的

前排 :eyes:

做集成的确实得先啃能力边界那部分,同意

三种输入这块要是稳定,剪辑流程能省不少事

视频当输入去续片段这块要真稳,接镜头的活能省不少熬夜。