深度强化学习里有种基于计数的探索方法,虽然是RL方向,但做生成的其实也能借点思路。核心问题是智能体怎么鼓励自己去试没见过的状态,简单说就是给稀有的、没怎么访问过的情况加分,逼它别老在熟悉的地方打转。
这跟生图里我们想让模型别老出千篇一律的东西、多探索点新样式的诉求有点像。
信息不多,就标题这点,感兴趣的可以顺着计数探索这个词去挖。
深度强化学习里有种基于计数的探索方法,虽然是RL方向,但做生成的其实也能借点思路。核心问题是智能体怎么鼓励自己去试没见过的状态,简单说就是给稀有的、没怎么访问过的情况加分,逼它别老在熟悉的地方打转。
这跟生图里我们想让模型别老出千篇一律的东西、多探索点新样式的诉求有点像。
信息不多,就标题这点,感兴趣的可以顺着计数探索这个词去挖。
RL和生成互相借思路的地方确实不少
给稀有状态加权这套思路,跟采样多样性那边其实能对上
给稀有状态加权跟采样多样性确实是一个路子,难的是生图这边怎么定义没见过