图片转文字这类应用,demo 看着简单,一句话就能描述照片,真做起来边界特别多。识别一张风景照没问题,但换成手写体、密集文字的截图、多语言混排、带遮挡的商品图,准确率立刻掉下来。
还有个容易被忽略的坑是它会自信地编,看不清的地方直接脑补一个合理答案,你不核对根本发现不了。做产品的话得想清楚场景:是给视障用户读屏,还是给电商批量提取商品信息,还是做无障碍字幕,每个场景对错误的容忍度完全不同。
别拿一个通用模型糊所有场景,边界不划清,上线就是投诉。
图片转文字这类应用,demo 看着简单,一句话就能描述照片,真做起来边界特别多。识别一张风景照没问题,但换成手写体、密集文字的截图、多语言混排、带遮挡的商品图,准确率立刻掉下来。
还有个容易被忽略的坑是它会自信地编,看不清的地方直接脑补一个合理答案,你不核对根本发现不了。做产品的话得想清楚场景:是给视障用户读屏,还是给电商批量提取商品信息,还是做无障碍字幕,每个场景对错误的容忍度完全不同。
别拿一个通用模型糊所有场景,边界不划清,上线就是投诉。
它会自信地编这点太坑了,看不清就脑补
手写体和密集截图确实掉准,我做发票识别栽过
多语言混排最难,中英夹着直接乱
视障读屏和电商提取容错率完全两码事,认同
通用模型糊所有场景这句戳中,产品经理最爱这么干
有遮挡的商品图我试过,缺的部分它敢给你补全
不核对根本发现不了,这才是最危险的