1.基本を理解
読み方・用語解説- 読み方
- ほうさくこうはいほう(または「ほうさくぐらでぃえんとほう」)
- 英語名
- Policy Gradient
- 提唱者・年代
- Williams(1992年)やSuttonら(1999年)
💡 豆知識——“gradient=増える方向の傾き”。“報酬がもっと得られる方策”へ、丘を上るように更新する。
【セットで覚えたい関連用語】
2.意味(定義)と例え話
方策をパラメータ化し、期待収益を最大化するように勾配を用いて方策のパラメータを直接更新するモデルフリー手法。連続行動空間に対応しやすい。
1990年代の手法(Silverら。REINFORCEはWilliams、1992)。“価値関数を介さず、方策そのものを”直接学習する。連続的な行動空間への対応が特に得意。
ゴルフの振り——“もう少しこうすると、球が遠く飛んだ”方向に、少しずつ調整していく、あの“報酬方向への微調整”。
AlphaGoやRLHFの系譜。LLMも“良い/悪いのフィードバックで方策を勾配で更新”する。
「方策のパラメータを勾配で直接更新/モデルフリー/連続行動に強い」が鉄板。
3.直前に理解(Q&A)
7問Q1. 方策勾配法とは?最頻出
方策をパラメータ化し、期待収益を最大化するように勾配を用いて方策のパラメータを直接更新するモデルフリー手法。
Q2. 仕組みは?最頻出
報酬の期待値が大きくなる方向(収益の勾配)へ方策を動かす。
Q3. REINFORCEとは?頻出
方策勾配法の代表的なアルゴリズム(Williams、1992)。
Q4. 「価値関数が必要」は正しい?ひっかけ
誤り。価値関数を介さず、方策を直接更新する(モデルフリー)。
Q5. 得意なのは?頻出
連続的な行動空間(離散だけでなく、任意の行動値)。
Q6. 提唱者と年代は?頻出
Williams(1992年)やSuttonら(1999年)
Q7. 位置づけは?親と子
強化学習 ⊃ 方策勾配法。
4. まとめ
方策勾配法=方策をパラメータ化し、期待収益を最大化するように勾配でパラメータを直接更新する手法。