世界模型这词最近被机器人和自动驾驶用得快成专属名词了,但生数科技把它拆成理解、想象、行动三段,反而讲清了它不只是「预测下一帧」。他们的逻辑是同一套基座:Vidu负责生成会持续变化的数字世界,Vidu S1把用户的实时指令纳进生成循环、能连续交互,Motubrain则把理解和预测转成机器人能执行的动作,底层用MoT架构让像素空间和动作空间共用一套。
作为做产品的,我最想盯的是那个正向循环能不能真跑通——视频预训练给机器人喂通用世界知识,机器人的真实行动再反过来补物理约束。
愿景是够大,但最后还得看内容提效和机器人稳定落地这两头的账算不算得过来。