刚扫到京东这边开源了一个图像模型,卖点是空间理解,就是让AI不光认出画面里有啥,还能搞清楚物体之间的前后、左右、遮挡这种位置关系。这块一直是生图和识图的老大难,很多模型你让它画“杯子在书的左边、书在灯的后面”,出来的图经常各种穿插打架,位置全乱。
要是这个方向真能开源出来给大家扒代码,那对做产品的、做数据集的都挺有价值的。
我打算先把仓库拉下来看看它的结构设计,尤其想知道空间那部分是靠什么模块顶起来的。
刚扫到京东这边开源了一个图像模型,卖点是空间理解,就是让AI不光认出画面里有啥,还能搞清楚物体之间的前后、左右、遮挡这种位置关系。这块一直是生图和识图的老大难,很多模型你让它画“杯子在书的左边、书在灯的后面”,出来的图经常各种穿插打架,位置全乱。
要是这个方向真能开源出来给大家扒代码,那对做产品的、做数据集的都挺有价值的。
我打算先把仓库拉下来看看它的结构设计,尤其想知道空间那部分是靠什么模块顶起来的。
蹲一个仓库地址
京东做这个我有点意外,还以为它只会搞电商那套图
看懂空间和真的理解空间还是两码事,得看它拿什么数据训的
同意,拿几张多物体叠一起的图一试就露馅