有人问上下文工程那套思路能不能搬到图片生成里,我觉得挺能。文本里讲的是给模型铺足够的背景,让它接下来的输出有依据;放到出图上,就是别指望一句话把所有信息塞进去,而是分层给。
先定世界观和风格基调,再给主体细节,再给镜头和光线,甚至用参考图当作视觉上下文。
多智能体分步细化本质也是这个逻辑。核心不变:模型需要的是结构化的前提,不是一坨扁平的关键词。
有人问上下文工程那套思路能不能搬到图片生成里,我觉得挺能。文本里讲的是给模型铺足够的背景,让它接下来的输出有依据;放到出图上,就是别指望一句话把所有信息塞进去,而是分层给。
先定世界观和风格基调,再给主体细节,再给镜头和光线,甚至用参考图当作视觉上下文。
多智能体分步细化本质也是这个逻辑。核心不变:模型需要的是结构化的前提,不是一坨扁平的关键词。
分层给这个思路对,一句话塞满肯定崩
参考图当视觉上下文这招我常用,比堆词稳多了