国产多模态在中文场景反超,票据招牌识别比我原来那套准

这两年国产多模态是真起来了,从最早只能跟着追,到现在图文、图生、理解这几块不少场景已经能打。我自己接项目,之前默认调国外的多模态接口,最近试着把一部分切到国产的,中文场景下对本土梗、招牌、票据这类东西的识别反而更准,价格还便宜一截。

多模态这仗关键不在单点跑分,而在数据和落地场景——谁离真实的中文数据和业务近,谁就能把长尾case喂出来。

当然也别吹太满,复杂推理和长上下文那块差距还在。整体方向是对的,能省成本我就用。

中文票据和招牌识别国产确实更准,亲测

价格便宜这点对小团队太香了

1 个赞

复杂推理还是差口气,别吹太满

确实

接口切过去了,中文场景基本无缝