最近在啃强化学习,卡在安全探索这块。智能体在训练早期为了探索会做出各种危险动作,仿真里无所谓,一旦上真实系统这些试错可能直接出事。看到有把安全探索做成基准测试的方向,就是给算法定一套统一的评估标准,看它在带约束的环境里既能学到东西又不越界。
想请教下有没有实际跑过这类基准的朋友,约束违反次数和最终收益之间那个权衡,一般是怎么调的。
我这边是想把结论借鉴到一个有物理限制的控制场景,怕的就是探索阶段把设备搞坏。
最近在啃强化学习,卡在安全探索这块。智能体在训练早期为了探索会做出各种危险动作,仿真里无所谓,一旦上真实系统这些试错可能直接出事。看到有把安全探索做成基准测试的方向,就是给算法定一套统一的评估标准,看它在带约束的环境里既能学到东西又不越界。
想请教下有没有实际跑过这类基准的朋友,约束违反次数和最终收益之间那个权衡,一般是怎么调的。
我这边是想把结论借鉴到一个有物理限制的控制场景,怕的就是探索阶段把设备搞坏。
安全探索这块坑挺深,约束一紧收敛就慢
同问
真实系统上做探索确实吓人,一般都先在仿真里把边界摸清
mark 一下,我也在做带约束的控制
建议先明确你的约束是硬约束还是软约束,调法完全不一样
硬约束一般直接加个safety layer挡在动作前面,比在reward里调省心;软约束才是真纠结,权重一动收敛就飘