做过一阵 AI agent,后来搬回出图流程,发现有些东西确实能借。最直接的是把出图当成一条可编排的管线:拆步骤、定每步的输入输出、失败了能回退重跑。ComfyUI 本质就是这套思路的可视化,你把打光、构图、放大、修手拆成节点,跟 agent 里拆 task 是一个味道。
第二个能借的是评估意识——agent 要有判断结果好坏的环节,出图也一样,我会在管线末端挂个自动打分或者人工卡点,别让废图直接流到交付。
反过来 agent 那套过度抽象的编排在出图里没必要,图这东西人眼一秒就能判好坏,别为了工程优雅把流程搞复杂了。