DeepMind 做了个手语转文本的模型,Pixel 11 上先落地

手语转文本的模型出来了,第一个消费级应用放在了 Pixel 11 上。手语识别这条线以前一直卡在两处:一是它不只是手势分类,表情、口型、身体朝向都在携带语义,漏掉一个通道整句意思就偏了;二是要做到能用,得连续识别再输出通顺的句子,不能一个词一个词往外蹦。

真放到手机上跑,还要面对单摄像头、光线差、手频繁出画这些现实情况。

具体支持哪套手语体系、识别范围到什么程度,暂时没有细节,等上手反馈吧。这类东西能进到系统级应用里,比一直停在论文阶段有意义。