世界模型也开始分级了,L1到L5这条线捋得挺清楚

L1 到 L5 这套分级我是认的,最大的好处是把“世界模型”这个大词拆开了。

以前谁都说自己在做世界模型,可一个在生成视频,一个在做机器人策略,压根不在同一层上,放一块讨论基本就是自说自话。现在这条线是这么排的:

  • 先学会生成连贯的世界演化
  • 再能被实时输入干预
  • 然后把动作落进物理世界
  • 最后才谈自主决策和多体协同

前三级已经有对应的东西落了地,依次是视频生成、能靠语音实时介入的、把理解预测和动作统一进同一个模型的。拿这张表一对,谁在做哪一层、离下一层差什么,一眼就清楚,不用再听各家自己怎么定义。

我印象比较深的是他们强调失败数据同样有价值。纠正和恢复的过程本身就带学习信号,这跟教学里错题往往比对题更有用是一个道理:对题只说明你做对了,错题能看出是哪一步想岔、又是怎么掰回来的,后者对下一次更有用。

L4 往上真正难的是目标从哪儿来。前面几级再难,要做的事都是外面给定的;到了自主决策,目标得自己生出来,这个目前还没人解决。

L3那种统一模型,有人实测过延迟吗

这分法有点像自动驾驶那套分级,好沟通,也容易被拿去做宣传