具身数据这波,反倒让我更看好视频生成模型的位置

WAIC那场聊具身数据的讨论挺有嚼头,核心观点是行业真缺的不是时长,是‘开箱即用’的高精度多模态数据,光有互联网上百亿小时人类视频只够让模型看懂世界,喂不出精准操作。

我更关注遮挡补全那块——手被物体挡住时,用视频生成模型基于前后帧预测中间的手部姿态,跟咱们做生图补全其实是一套思路。

手部追踪压到亚厘米级、无效帧控制在3%以内,背后那套多源融合校正才是硬功夫。数据是地基这话真不夸张,架构再花哨没料也白搭。

遮挡补全那段确实,视频生成早晚是各种数据管线的标配

亚厘米级听着挺猛,就是不知道量产一致性咋样

mark

数据才是地基,这句年年有人说年年没人真肯做 :man_facepalming:

1 个赞