方策
状態から行動への写像。 policy、。 強化学習が最終的に求めるもの。
決定的な方策なら 。
探索と活用#
学習中の方策は、既知の良い行動(活用)と 未知の行動の試行(探索)を両立させる必要がある。
| 手法 | 内容 |
|---|---|
| -greedy | 確率 でランダム、それ以外は最良 |
| softmax / Boltzmann | |
| UCB | 不確かさの大きい行動を優先 |
Boltzmann 方策の温度 は 焼きなまし法の温度と同じ役割。 探索と活用の配分は最適化全般に共通する構造。
方策勾配法#
価値関数を経由せず、方策を直接パラメータ化して勾配で改善する。
方策勾配定理。良い結果を出した行動の確率を上げる、という形。
利点。
- 連続行動を自然に扱える
- 確率的方策をそのまま表現できる
欠点は分散が大きいこと。 ベースライン(価値関数)を引いて分散を減らすのが Actor-Critic。
PPO は更新幅を制限して安定化した手法で、 RLHF で広く使われている。
参考文献#
- Richard S. Sutton, Andrew G. Barto. Reinforcement Learning: An Introduction, 2nd ed. MIT Press, 2018.(全文公開) http://incompleteideas.net/book/the-book-2nd.html
- Richard S. Sutton et al. Policy Gradient Methods for Reinforcement Learning with Function Approximation. NeurIPS, 1999. https://proceedings.neurips.cc/paper/1999/hash/464d828b85b0bed98e80ade0a5c43b0f-Abstract.html
- John Schulman et al. Proximal Policy Optimization Algorithms. 2017. https://arxiv.org/abs/1707.06347