看到Agnes AI这次直接把文本、图像、视频三个模态的核心模型一起端出来了。现在做全模态是明显的趋势,一家把三条线都自己攥着,好处是模态之间能对齐、共享表征,理论上跨模态生成会更顺,比如文生图再到图生视频这条链路走通了体验会连贯很多。
当然一起发也意味着每一条单拎出来跟专精选手比,未必都能打到第一梯队,这个得看它各自的实际表现。
比较想知道三个模型是共享底座还是各练各的,以及有没有开放接口能上手。等有能试的入口了跑几个跨模态的case看看。
看到Agnes AI这次直接把文本、图像、视频三个模态的核心模型一起端出来了。现在做全模态是明显的趋势,一家把三条线都自己攥着,好处是模态之间能对齐、共享表征,理论上跨模态生成会更顺,比如文生图再到图生视频这条链路走通了体验会连贯很多。
当然一起发也意味着每一条单拎出来跟专精选手比,未必都能打到第一梯队,这个得看它各自的实际表现。
比较想知道三个模型是共享底座还是各练各的,以及有没有开放接口能上手。等有能试的入口了跑几个跨模态的case看看。
mark
全模态一起发,八成是想讲一个统一底座的故事
就怕三个都做,三个都半吊子
跨模态一致性要是真做通了那挺香