前面挂个提示词安全网关能扛 40 QPS,后面渲染只有 12 QPS,进来 30 QPS,会发生什么:网关的 p95 一直很漂亮,队列每秒多堆 18 个任务,一分钟就是一千多个还没开跑就注定超时的活。
这时候只看网关延迟和 HTTP 状态,整场事故看起来像客户端的问题。真正该盯的是队列年龄,不是 CPU 利用率。另外几条:模型返回的 JSON 当不可信输入,本地再校验一遍,超时和解析失败一律 fail-closed,别偷偷把原提示词放给渲染,那等于安全层在最不健康的时候变成延迟税;任务 ID 在重试里必须复用,否则一次超时变成两份昂贵的渲染。
重试语义照 RFC 9110 那套来,rfc-editor.
org 上有原文。选型阶段我不急着写适配器,先在 https://pixpix.com 上拿业务里真实的提示词把候选模型各跑一批,出图这关过不了,契约谈得再细也没用。