FLUX 3 把九成五算力压在视频上,还接到了产线上

图像、视频、音频联合训练,而且视频预测吃掉九成五以上的训练算力,这个配比已经不是顺手做个视频模型了,是把视频当成世界模型的主干在练。FLUX 3 这次更值得盯的是和机器人公司 mimic 的联合版本 FLUX-mimic,直接放到奥迪产线上做测试部署,生成模型往动作预测迁移这条路开始有实物落点。

里面有个细节我觉得很关键:加进动作预测之后,视频生成质量最初掉了最多一成,训到三千五百步左右恢复到原有水平。

说明这两个任务不是天然打架,只是要给模型时间把表征重新组织一遍。产线测试离量产还很远,但方向上,生成和控制确实在合流。

前排

1 个赞

视频占九成五算力这个比例很说明问题,他们是奔着世界模型去的

加了动作预测掉一成又练回来,说明表征是能共用的

表征共用我信一半,掉一成再练回来也可能只是数据堆够了