FLUX 3 想用一套模型同时管内容和机器人

一个做图像生成起家的团队,把汽车厂和机器人公司拉进来做真机测试,这个动作本身比模型跑分更值得琢磨。

这次的叙事讲得很直白:内容创作和物理世界的智能,共用一套视觉基础模型。往下拆,短期真能落地的是原生音频那块,视频自带声音,对做广告片和素材的团队等于直接省掉一道后期。动作预测那条线周期长得多,合作方是 mimic 和 Audi,真机上的结论没那么快出得来。

节奏也很典型:视频先开 early access 收反馈和数据,权重后放。对要排期的人来说,early access 阶段的能力写不进正式方案,只能先摸个底,心里有数就行。

原生音频这块确实省事,剪片子能少一整道工序

馋了 :fire:

1 个赞

权重没放之前我是不敢往方案里写的,翻车过一次

Audi 那个合作更像站台,真上产线还早得很

一套 backbone 什么都做,通常意味着哪一端都不是最强的那个,先观望

同观望,一套 backbone 通吃听着美,机器人那边对延迟的要求跟出图根本两码事