WAIC那场聊具身数据的讨论挺有嚼头,核心观点是行业真缺的不是时长,是‘开箱即用’的高精度多模态数据,光有互联网上百亿小时人类视频只够让模型看懂世界,喂不出精准操作。
我更关注遮挡补全那块——手被物体挡住时,用视频生成模型基于前后帧预测中间的手部姿态,跟咱们做生图补全其实是一套思路。
手部追踪压到亚厘米级、无效帧控制在3%以内,背后那套多源融合校正才是硬功夫。数据是地基这话真不夸张,架构再花哨没料也白搭。
WAIC那场聊具身数据的讨论挺有嚼头,核心观点是行业真缺的不是时长,是‘开箱即用’的高精度多模态数据,光有互联网上百亿小时人类视频只够让模型看懂世界,喂不出精准操作。
我更关注遮挡补全那块——手被物体挡住时,用视频生成模型基于前后帧预测中间的手部姿态,跟咱们做生图补全其实是一套思路。
手部追踪压到亚厘米级、无效帧控制在3%以内,背后那套多源融合校正才是硬功夫。数据是地基这话真不夸张,架构再花哨没料也白搭。
遮挡补全那段确实,视频生成早晚是各种数据管线的标配
亚厘米级听着挺猛,就是不知道量产一致性咋样
mark
数据才是地基,这句年年有人说年年没人真肯做 ![]()