很多人把这类 lora 理解成单纯放开限制,我觉得跑偏了。以前那些 bypass 系的做法是硬掰输出分布,副作用就是情绪表达变木、角色特征跟着一起丢,你让它做个表情它给你一张呆脸。
而降拒绝这条路子如果做得干净,模型不再在中途跟你拉扯,剩下的算力才真去对齐你写的东西,所以外面放出来的样例里情绪和角色知识保留得反而更好——这不是玄学,是少了一层内耗。
我自己还没上手跑,暂时只能算旁观判断。另外原帖被删这事挺可惜的,作者以前放过别的工具,起码不是三无。有跑过的说说角色一致性在多轮编辑下掉不掉?
很多人把这类 lora 理解成单纯放开限制,我觉得跑偏了。以前那些 bypass 系的做法是硬掰输出分布,副作用就是情绪表达变木、角色特征跟着一起丢,你让它做个表情它给你一张呆脸。
而降拒绝这条路子如果做得干净,模型不再在中途跟你拉扯,剩下的算力才真去对齐你写的东西,所以外面放出来的样例里情绪和角色知识保留得反而更好——这不是玄学,是少了一层内耗。
我自己还没上手跑,暂时只能算旁观判断。另外原帖被删这事挺可惜的,作者以前放过别的工具,起码不是三无。有跑过的说说角色一致性在多轮编辑下掉不掉?