小体积视觉模型开始啃文档了,权重还给Apache 2.0

一个人做游戏,最费时间的往往不是画画,是翻资料。硬盘里堆着扫描的设定集、武器结构图、还有从各处存下来的参考PDF,找一张图全靠记忆。前阵子开始拿视觉语言模型干这活,让它把图和文字一起读了建索引,问一句就能定位到某页某张图。

所以新出的North Micro Vision我挺有兴趣,主打就是文档理解,体积是他们家目前最小的一个,权重按Apache 2.0放在huggingface.

co上,商用也不用绕弯。小体积的好处很实在:本地能跑,不用把自己还没发布的美术资料往外传,显存也留得出来继续跑出图。等我接进现有的检索流程再回来说效果。

mark

1 个赞

这么卷

文档理解这类小模型本地跑最合适,资料不用往外传。

Apache 2.0这点很关键,商用能省一堆事。

接好了记得回来讲效果,我也一堆PDF没整理 :pray: