生成模型在低噪声区容易崩,这个盲区值得琢磨

有个现象一直想不通:明明训得好好的模型,喂进去看着人畜无害的数据,偶尔就吐一堆废图,输入稍微动一点输出就飘得离谱。看了些资料才知道问题可能藏在低噪声那段。大意是注入的噪声趋近于零的时候,模型内部那个引导生成的velocity场会变得极其敏感,学习过程不稳,最后表现出来就是生成质量掉链子。

打个比方就像船舵一碰就乱摆,根本掌不住方向。应对上一种思路是混合训练,中高噪声还用常规的velocity回归,噪声很低的时候切到对比学习那套;另一种是在低噪声段更看重让内部特征跟目标对齐,而不是直接硬预测。

对我们做可视化的来说这些偏底层,但理解一下模型脾气也不亏。

velocity场敏感这个解释挺形象

混合训练的切换阈值怎么定

低噪声崩溃第一次听说,去查查论文

船舵那个比喻到位

特征对齐这条路感觉更好落地

确实

低噪声区崩这个盲区第一次听说,切换阈值到底怎么定挺玄