Flux 3 这次动的地方比我预期的深。Black Forest Labs 把原生动作预测直接集成进了模型,算是把之前 Self-Flow 那条线往前推了一步:拿预训练的视频骨干当理解动力学的底座,专门的动作模型只用少量任务数据微调就能起来。
说白了是把「会画」和「懂东西怎么动」压到同一个地基上。合作方里有做机器人的 mimic,属于首批拿到早期访问的,这个组合挺说明问题,视觉生成往具身那边靠已经不是概念阶段了。
初评说压过了 Seedance 2.0,这种早期对比看看就行,等权重真放出来各自跑一轮才作数。