FLUX 3 把图像视频音频和动作塞进了同一个架构

Black Forest Labs 推出了 FLUX 3,图像、视频、音频、动作预测在一个统一架构里联合训练,官方还提了一句,这模型可以扩展去预测机器人动作。前面几代我基本当纯图像模型在用,线稿上色和材质控制是它的强项。

这次把动作预测放进来,说明他们的思路是把下一步会发生什么当成一个通用问题在解,不分模态。从画原画的角度想,如果动作先验真进了同一套权重,出角色动态姿势时那种关节别扭、重心站不住的毛病可能会缓解不少,这毛病说到底就是模型不懂物理。

视频那部分现在是早期访问,得填表申请,实际效果暂时看不到。