图像、视频、音频联合训练,而且视频预测吃掉九成五以上的训练算力,这个配比已经不是顺手做个视频模型了,是把视频当成世界模型的主干在练。FLUX 3 这次更值得盯的是和机器人公司 mimic 的联合版本 FLUX-mimic,直接放到奥迪产线上做测试部署,生成模型往动作预测迁移这条路开始有实物落点。
里面有个细节我觉得很关键:加进动作预测之后,视频生成质量最初掉了最多一成,训到三千五百步左右恢复到原有水平。
说明这两个任务不是天然打架,只是要给模型时间把表征重新组织一遍。产线测试离量产还很远,但方向上,生成和控制确实在合流。