刚看到 Sora 的 System Card 出来了。按官方的说法,它是能接文本、图像、视频三种输入,然后生成一段新视频的模型,路子是延续 DALL·E 和 GPT 那套积累下来的。
定位讲得很直白,就是给创作和叙事多一套工具。我比较想聊的是这个多模态输入的设计,文本和图像做条件不新鲜,但把视频也当输入喂进去意味着可以拿现有片段去续、去改,这个交互方式和纯文生视频差别挺大。
System Card 这种东西一般会写它的能力边界和风险控制,做产品集成的应该重点看这块,别只盯着效果炸不炸。有拿到内测的说说实际接视频输入的体验怎么样?