一个做图像生成起家的团队,把汽车厂和机器人公司拉进来做真机测试,这个动作本身比模型跑分更值得琢磨。
这次的叙事讲得很直白:内容创作和物理世界的智能,共用一套视觉基础模型。往下拆,短期真能落地的是原生音频那块,视频自带声音,对做广告片和素材的团队等于直接省掉一道后期。动作预测那条线周期长得多,合作方是 mimic 和 Audi,真机上的结论没那么快出得来。
节奏也很典型:视频先开 early access 收反馈和数据,权重后放。对要排期的人来说,early access 阶段的能力写不进正式方案,只能先摸个底,心里有数就行。