深度强化学习里的安全探索,有没有能对齐的基准

最近在啃强化学习,卡在安全探索这块。智能体在训练早期为了探索会做出各种危险动作,仿真里无所谓,一旦上真实系统这些试错可能直接出事。看到有把安全探索做成基准测试的方向,就是给算法定一套统一的评估标准,看它在带约束的环境里既能学到东西又不越界。

想请教下有没有实际跑过这类基准的朋友,约束违反次数和最终收益之间那个权衡,一般是怎么调的。

我这边是想把结论借鉴到一个有物理限制的控制场景,怕的就是探索阶段把设备搞坏。

安全探索这块坑挺深,约束一紧收敛就慢

同问

1 个赞

真实系统上做探索确实吓人,一般都先在仿真里把边界摸清

mark 一下,我也在做带约束的控制

建议先明确你的约束是硬约束还是软约束,调法完全不一样

硬约束一般直接加个safety layer挡在动作前面,比在reward里调省心;软约束才是真纠结,权重一动收敛就飘