基于模型的控制来做“线上规划、线下学习”,这思路值得琢磨

刚扫到一篇讲高效学习与探索的工作,核心是用基于模型的控制来把规划和学习分开:在线的时候做规划,离线的时候学习和探索。标题信息有限,我只按字面聊聊为什么这个拆分有意思。

强化学习里探索和利用的矛盾一直很头疼,纯在线学又慢又不稳。把重的学习和探索挪到离线、在线只留轻量的规划,理论上能让实际运行时反应更快、更可控。这套思路和生成模型这两年的发展也隐约呼应,都是想办法把算力和数据消耗前置到离线阶段。

具体效果还得看原文的实验,光凭标题不好下结论,但这个分工方向我个人是看好的。

蹲原文实验数据

在线规划离线学习这个拆法,落地到机器人控制应该挺香

1 个赞

探索利用的矛盾确实是老大难了

mark 回头找论文看

:+1: