团队里非技术的同事总把这俩搞混,我自己也想先理清楚再去解释。我的理解是万相偏生成图片和视频这类视觉内容,千问更像对话和处理文字的大模型,一个管画一个管说。
但具体到实际用,比如我想让它先理解需求再出图,是不是得两个配合、还是万相自己就带理解?定位、能力边界这块我没底,不敢乱给同事科普。
有没有实际项目里两个都接过的朋友,帮我把它俩的分工和适用场景讲明白点,我好整理成一页给团队看。
团队里非技术的同事总把这俩搞混,我自己也想先理清楚再去解释。我的理解是万相偏生成图片和视频这类视觉内容,千问更像对话和处理文字的大模型,一个管画一个管说。
但具体到实际用,比如我想让它先理解需求再出图,是不是得两个配合、还是万相自己就带理解?定位、能力边界这块我没底,不敢乱给同事科普。
有没有实际项目里两个都接过的朋友,帮我把它俩的分工和适用场景讲明白点,我好整理成一页给团队看。
理解方向没错,一个管画一个管文字,场景里经常是配合着用。
整理成一页给团队这思路好,能省不少解释成本。
了解
我实际是千问理解需求、万相出图,分两步更可控。
定位这块说法也一直在变,别写太死免得很快过时。