Flux 3 出来了,视频这块直接对上第一梯队

Black Forest Labs 把 Flux 3 放出来了,这回不只是图像模型,一套统一架构同时管图像、视频、音频,还能往机器人动作预测上扩。视频那块给的说法是二十秒左右、自带音频,水准对标 Seedance 2 和 Gemini Omni 那一档,目前开的是早期访问。

做图像起家的团队一步跨到带音频的视频生成,还是同一套架构扛下来,这个路线本身比任何单项指标都值得看。

统一架构的好处是模态之间共享表征,理论上口型和动作能对得更准;坏处是每个模态单拎出来都很难做到极致。到底是哪一头,得等拿到早期访问的人放出真片子才知道。

前排 :fire:

等个实测,二十秒带音频这说法太模糊,是原生音频还是后期配的

Flux 的图像审美一直在线,视频要是能延续这个调性我就换阵营

同问是不是原生音频,之前几家吹统一架构,实际音画对不上