扒四万多条评论去反推可灵到底适合谁,这个方法我挺认。比起厂商自己列的参数表,真实用户在评论里骂什么、夸什么,才是产品定位的地面真相。结论大概是它有明确主场——不是全能王,而是在某类场景里口碑集中。
做数据的都清楚,四万多的样本量足够把噪音磨掉、把真实需求跑出来。我更好奇的是清洗环节怎么做的:评论里水军、复读、跨话题串味特别多,光去重和情感分类就够喝一壶。
谁适合谁不适合,与其看宣传,不如看这种大样本的口碑聚类。
扒四万多条评论去反推可灵到底适合谁,这个方法我挺认。比起厂商自己列的参数表,真实用户在评论里骂什么、夸什么,才是产品定位的地面真相。结论大概是它有明确主场——不是全能王,而是在某类场景里口碑集中。
做数据的都清楚,四万多的样本量足够把噪音磨掉、把真实需求跑出来。我更好奇的是清洗环节怎么做的:评论里水军、复读、跨话题串味特别多,光去重和情感分类就够喝一壶。
谁适合谁不适合,与其看宣传,不如看这种大样本的口碑聚类。
mark
四万条评论怎么爬下来的才是我最关心的
情感分类那块估计得一半靠人工校,纯模型判不准反讽
同问
评论区水军是真多,清洗不干净结论就整个歪了
主场这说法比全能王实在,起码不忽悠人
水军这关不过结论全歪,评论区一半彩虹屁一半黑稿,不做去水直接跑情感分类等于自欺欺人 ![]()