两边都跑了大半年,我的结论其实很平淡:这俩不是谁强谁弱,是吃的prompt完全不一样。DALL·E要你写得像需求文档,主体、材质、光线、镜头一条条列清楚,它就老老实实给你一张接近照片的东西;同样一句话丢给V7,它会自己加一层解释,出来的画面更像手绘或者油画。
最明显的一次是「赛博朋克猫」,DALL·E给我一只穿皮衣拿枪的猫,字面到有点无聊;V7那版身体是拉长扭曲的,周围一圈霓虹烟雾,说不上准确但确实抓人。反过来做产品图、建筑效果这种要可控的活,我还是老实回去用DALL·E。
踩过的坑是DALL·E同一个prompt反复跑容易出高度雷同的构图,得主动换措辞把它打散。真要我只留一个,我偏V7一点,纯粹因为它更容易给我意外。