电商搜索这块平时跟画图不太沾边,但这次的评测设计我看完还挺有想法。Ontology 1 在自建的 90 条查询集上拿到 P@10 0.630,谷歌购物 0.543,亚马逊 0.
469,而它索引的商品量大概只有对手的百分之一。核心做法是不信商家写的标签,把"宠物友好"这类模糊说法拆成可核对的属性再去匹配,数据对不上的宣称还会被标出来。
但评分是三个大模型当评委,评委之间的一致性只有 0.465,绝对分数别太当真,只有排序是三家评委都一致的。目前只覆盖家居家具一个垂类,权重和公开接口都没有。
电商搜索这块平时跟画图不太沾边,但这次的评测设计我看完还挺有想法。Ontology 1 在自建的 90 条查询集上拿到 P@10 0.630,谷歌购物 0.543,亚马逊 0.
469,而它索引的商品量大概只有对手的百分之一。核心做法是不信商家写的标签,把"宠物友好"这类模糊说法拆成可核对的属性再去匹配,数据对不上的宣称还会被标出来。
但评分是三个大模型当评委,评委之间的一致性只有 0.465,绝对分数别太当真,只有排序是三家评委都一致的。目前只覆盖家居家具一个垂类,权重和公开接口都没有。
自己出题自己考这种,看个方向就行了