TensorRT FP4 加速出图,50 系显卡能爽到吗?

TensorRT配FP4加速出图,50系显卡到底能爽到什么程度,我拿手上的机器试了试。开TensorRT之后同样的Flux模型出图速度确实跳了一大截,配合50系原生支持的FP4,显存占用也降了不少,批量跑的时候差距最明显。

但这套不是白拿的好处——TensorRT得先把模型编译成引擎,分辨率、batch一变就可能要重编,折腾成本在那儿。而且不是所有节点和采样器都吃这套加速,遇到不支持的还是走常规路。

如果你是固定分辨率批量出图的生产场景,编译一次爽用很久,值。要是天天换模型换尺寸瞎试,那点提速可能抵不过反复编译的麻烦。看你怎么用。

固定分辨率批量出图开TensorRT是真爽,一次编译用很久

换模型换尺寸就得重编,这折腾成本劝退天天试的人

FP4显存降得明显,50系批量跑差距最大

我就是天天换尺寸的,算下来那点提速抵不过重编

这个我熟