智象未来沿着原生全模态往前走,交互式世界模型 HiDream-O1-World 发布

原生全模态这条路径值得单独说两句。多数团队的做法是各模态各训一套,再拿适配层缝起来,好处是省事,代价是跨模态对齐总差一层。智象未来这回的 HiDream-O1-World 挂在原生全模态的进阶上,方向又落在交互式世界模型,说明是想在一个底座里把理解和生成一起做掉。

这条路难在数据配比和训练稳定性,某个模态收敛慢就会拖住全局。

名字之外的东西现在还看不到,能力边界是空的。工程上我更好奇它的交互是模型自己维持状态,还是外面又套了一层记忆模块。

原生全模态和后期拼模块差别挺大的,训练成本也不在一个量级

围观