Black Forest Labs 把 Flux 3 放出来了,这回不只是图像模型,一套统一架构同时管图像、视频、音频,还能往机器人动作预测上扩。视频那块给的说法是二十秒左右、自带音频,水准对标 Seedance 2 和 Gemini Omni 那一档,目前开的是早期访问。
做图像起家的团队一步跨到带音频的视频生成,还是同一套架构扛下来,这个路线本身比任何单项指标都值得看。
统一架构的好处是模态之间共享表征,理论上口型和动作能对得更准;坏处是每个模态单拎出来都很难做到极致。到底是哪一头,得等拿到早期访问的人放出真片子才知道。