FLUX 3来了,图像视频音频加动作预测全塞进一个模型

Black Forest Labs这次跨得有点大。FLUX一直是我做概念设定时最常摸的一档,胜在对结构和材质的理解稳,出图不飘。新的FLUX 3把图像、视频、音频放进同一套架构里联合训练,同一组权重还能输出动作预测——最后这项明显是冲着机器人去的,对我们做视觉的人来说更像顺带的副产品。

真正能上手的是Video那部分,单次最长20秒且自带原生音频,在10秒720p的文生视频人类偏好测试里对Luma Ray 3.

2拿到93%。偏好测试的水分向来不小,不过差成这样也不像同一个量级了。我更在意的是图像那一档有没有因为要兼顾视频而往回退。

同一组权重直接出动作预测,这是真往具身那边靠了

93%看看就行,测试怎么选的样本没人说得清