用GRPO+LoRA训Gemma-3做数学推理的一套完整流程,记录一下

折腾了一套用GRPO强化学习训Gemma-3做结构化数学推理的完整流程,跑的是GSM8K那批数学题,用JAX加LoRA适配器,单卡就能搞。核心思路是只训LoRA那点适配器权重,底模冻着,这样轻量又省显存。

关键在奖励函数设计:一部分打分看输出格式规不规范——推理放进reasoning标签、最终数字答案放进answer标签;另一部分直接对答案正确性打分,还留了个兜底的数字提取。

跑之前先测基线,GRPO之后再对比准确率和格式服从度,两头一比就知道训练有没有效果。整套下来对想在小显存上试强化学习后训练的人挺友好,工作流够紧凑。

1 个赞

只训LoRA权重底模冻着,单卡党福音 :pray:

奖励函数设计才是精髓,格式+正确性双信号

GSM8K这数据集经典

mark,回头照着跑一遍