FLUX 3 昨天发的,一个底座同时做图像、视频、音频,视频还带原生同步音轨,最长20秒,现在早期访问得排队。真正有意思的是它背后那套 Self-Flow:训练时给同一张图不同区块喂不同强度的噪声,干净的区块被迫去重建噪声大的区块,表征学习就这么长在 flow matching 目标里,不用再挂对比或掩码的额外头。
方法很漂亮,但公开的那个 checkpoint 只是 256×256 ImageNet 的研究模型,跟 production 的 FLUX 3 不是一回事,参数、架构、license 一个没披露。
最扎眼的是当年靠开源起家,这回旗舰直接锁早期访问,Dev 版说未来几周几个月再放、连日期都没给。