折腾了一套用GRPO强化学习训Gemma-3做结构化数学推理的完整流程,跑的是GSM8K那批数学题,用JAX加LoRA适配器,单卡就能搞。核心思路是只训LoRA那点适配器权重,底模冻着,这样轻量又省显存。
关键在奖励函数设计:一部分打分看输出格式规不规范——推理放进reasoning标签、最终数字答案放进answer标签;另一部分直接对答案正确性打分,还留了个兜底的数字提取。
跑之前先测基线,GRPO之后再对比准确率和格式服从度,两头一比就知道训练有没有效果。整套下来对想在小显存上试强化学习后训练的人挺友好,工作流够紧凑。