刚刷到 DeepMind 的 GenCeption,最抓眼的点是它把深度分割和姿态估计塞进了同一个模型里,不用再各跑一套管线。以前做这类任务,分割一个网络、姿态又一个网络,权重和后处理各自为政,接起来贼折腾。
要是真能一个模型统一输出,工程侧省的活儿不是一点半点。当然具体架构和效果得等它把细节铺开再看,现在能确认的就是这个多任务合一的方向。
有做三维视觉的同行没,这条路子你们怎么看,是通用大模型的思路往感知里渗,还是纯粹为了省算力做的任务合并。
刚刷到 DeepMind 的 GenCeption,最抓眼的点是它把深度分割和姿态估计塞进了同一个模型里,不用再各跑一套管线。以前做这类任务,分割一个网络、姿态又一个网络,权重和后处理各自为政,接起来贼折腾。
要是真能一个模型统一输出,工程侧省的活儿不是一点半点。当然具体架构和效果得等它把细节铺开再看,现在能确认的就是这个多任务合一的方向。
有做三维视觉的同行没,这条路子你们怎么看,是通用大模型的思路往感知里渗,还是纯粹为了省算力做的任务合并。
蹲细节
多任务合一这两年是真的猛,就怕单项精度被拉下来