把图像、视频、音频放进同一套联合学习里,目标是构建统一的世界表征,这个方向这两年越走越集中。分开训三个模型再靠适配层拼接,中间永远有信息损耗,声音里的节奏和画面里的运动本来就是同一件事的两面,拆开学等于自己给自己制造对齐问题。
真做成统一表征,像"给一段环境音生成匹配画面"这类活会顺很多,跨模态检索也跟着受益。代价通常是每个单项都比不上专门模型那么极致,具体折中到什么程度,只能等拿到 Early Access 的人放东西出来。
现在只开了 Early Access,先排队。
把图像、视频、音频放进同一套联合学习里,目标是构建统一的世界表征,这个方向这两年越走越集中。分开训三个模型再靠适配层拼接,中间永远有信息损耗,声音里的节奏和画面里的运动本来就是同一件事的两面,拆开学等于自己给自己制造对齐问题。
真做成统一表征,像"给一段环境音生成匹配画面"这类活会顺很多,跨模态检索也跟着受益。代价通常是每个单项都比不上专门模型那么极致,具体折中到什么程度,只能等拿到 Early Access 的人放东西出来。
现在只开了 Early Access,先排队。
统一表征这条路是对的,但每一项都平庸几乎是必然的代价
围观