Black Forest Labs 这回给 FLUX 3 的定位不是文生图,也不是文生视频,而是把图像、视频、音频和语言塞进同一套 multimodal flow 里,让不同模态互相约束着去学物理规律和因果关系。
产品线分三条:Video 最长二十秒并且原生带音频,Image 要之后才放,还有一条 Action 做动作预测,已经用在 FLUX-mimic 的机器人场景上了。
对天天出静态图的人来说这排序有点微妙,我们吃饭那条线这次被放在了后面。同一个底座既跑视频又跑图,画风取向会不会被视频素材带偏,我心里是真没底。