L1 到 L5 这套分级我是认的,最大的好处是把“世界模型”这个大词拆开了。
以前谁都说自己在做世界模型,可一个在生成视频,一个在做机器人策略,压根不在同一层上,放一块讨论基本就是自说自话。现在这条线是这么排的:
- 先学会生成连贯的世界演化
- 再能被实时输入干预
- 然后把动作落进物理世界
- 最后才谈自主决策和多体协同
前三级已经有对应的东西落了地,依次是视频生成、能靠语音实时介入的、把理解预测和动作统一进同一个模型的。拿这张表一对,谁在做哪一层、离下一层差什么,一眼就清楚,不用再听各家自己怎么定义。
我印象比较深的是他们强调失败数据同样有价值。纠正和恢复的过程本身就带学习信号,这跟教学里错题往往比对题更有用是一个道理:对题只说明你做对了,错题能看出是哪一步想岔、又是怎么掰回来的,后者对下一次更有用。
L4 往上真正难的是目标从哪儿来。前面几级再难,要做的事都是外面给定的;到了自主决策,目标得自己生出来,这个目前还没人解决。