原力灵机的DW0.5,思路是拿世界模型给VLA当教练

原力灵机发布了DW0.5,定位很清楚:用世界模型给VLA做训练,把强化学习那一套搬进虚拟世界里跑。

这个思路本身不新鲜,但落地一直卡在同一个地方。RL在真机上做是奢侈的,一次失败就是硬件损耗加上人工复位,采样效率低到没法看。所以大家都想把交互放进模拟器,问题是模拟器和真实世界之间那条缝——物理参数、接触力、材质反光——不管怎么调都还在,训出来的策略一进现实就露馅。世界模型的价值就在于它不是手工搭的模拟器,而是从数据里学出来的,理论上那条缝能小一点。

所以真正的看点其实是「学出来的环境到底准不准、能不能撑住足够长的rollout」。这个东西不太好用一两个数字说明白,也不是发个benchmark就能取信于人的。等看到真机上的表现再评价。

名字用0.5这种编号,看起来是有意留着往上走。

把RL搬进世界模型这个方向今年扎堆做的挺多,最后拼的还是数据