Black Forest Labs这次跨得有点大。FLUX一直是我做概念设定时最常摸的一档,胜在对结构和材质的理解稳,出图不飘。新的FLUX 3把图像、视频、音频放进同一套架构里联合训练,同一组权重还能输出动作预测——最后这项明显是冲着机器人去的,对我们做视觉的人来说更像顺带的副产品。
真正能上手的是Video那部分,单次最长20秒且自带原生音频,在10秒720p的文生视频人类偏好测试里对Luma Ray 3.
2拿到93%。偏好测试的水分向来不小,不过差成这样也不像同一个量级了。我更在意的是图像那一档有没有因为要兼顾视频而往回退。