生数科技把世界模型拆成生成、交互、行动三层

世界模型这词最近被机器人和自动驾驶用得快成专属名词了,但生数科技把它拆成理解、想象、行动三段,反而讲清了它不只是「预测下一帧」。他们的逻辑是同一套基座:Vidu负责生成会持续变化的数字世界,Vidu S1把用户的实时指令纳进生成循环、能连续交互,Motubrain则把理解和预测转成机器人能执行的动作,底层用MoT架构让像素空间和动作空间共用一套。

作为做产品的,我最想盯的是那个正向循环能不能真跑通——视频预训练给机器人喂通用世界知识,机器人的真实行动再反过来补物理约束。

愿景是够大,但最后还得看内容提效和机器人稳定落地这两头的账算不算得过来。

1 个赞

三款产品其实是一套能力的延伸,这个框架被讲清楚了

正向循环能不能跑通才是关键,同意这句

MoT把像素和动作放一个架构里,思路挺猛

蹲落地