FLUX 3 把图像视频音频塞进一个模型,但开源权重又跳票了

FLUX 3 昨天发的,一个底座同时做图像、视频、音频,视频还带原生同步音轨,最长20秒,现在早期访问得排队。真正有意思的是它背后那套 Self-Flow:训练时给同一张图不同区块喂不同强度的噪声,干净的区块被迫去重建噪声大的区块,表征学习就这么长在 flow matching 目标里,不用再挂对比或掩码的额外头。

方法很漂亮,但公开的那个 checkpoint 只是 256×256 ImageNet 的研究模型,跟 production 的 FLUX 3 不是一回事,参数、架构、license 一个没披露。

最扎眼的是当年靠开源起家,这回旗舰直接锁早期访问,Dev 版说未来几周几个月再放、连日期都没给。

Self-Flow 那个双时间步调度确实巧,坐等有人复现

开源跳票,BFL 这波把自己基本盘得罪得不轻

1 个赞

蹲 Dev 版

视频20秒还带音轨,要是真稳就够炸了 :fire:

参数一个没给,先当 PPT 看着

那个不渲染视频、直接读内部特征去控机器人才是真活,工程上省太多了

+1,说好的开源呢

同感,早期访问排队这套走完,等真放权重热度早凉了