G検定 × 解説記事

方策勾配法って結局なんなの?🧗

“報酬が増える方向に、方策を‘勾配’で更新する”——REINFORCE。

1.基本を理解

読み方・用語解説
読み方
ほうさくこうはいほう(または「ほうさくぐらでぃえんとほう」)
英語名
Policy Gradient
提唱者・年代
Williams(1992年)やSuttonら(1999年)

💡 豆知識——“gradient=増える方向の傾き”。“報酬がもっと得られる方策”へ、丘を上るように更新する。

【セットで覚えたい関連用語】

方
方策行動を決める関数(No.212)。学習の対象。
R
REINFORCE方策勾配法の代表的なアルゴリズム。
モ
モデルフリー環境のモデルを使わず、経験から学ぶ方式。

2.意味(定義)と例え話

一言で言うと?

方策をパラメータ化し、期待収益を最大化するように勾配を用いて方策のパラメータを直接更新するモデルフリー手法。連続行動空間に対応しやすい。

背景・歴史的流れ

1990年代の手法(Silverら。REINFORCEはWilliams、1992)。“価値関数を介さず、方策そのものを”直接学習する。連続的な行動空間への対応が特に得意。

身近な例え話

ゴルフの振り——“もう少しこうすると、球が遠く飛んだ”方向に、少しずつ調整していく、あの“報酬方向への微調整”。

AIとの関係

AlphaGoやRLHFの系譜。LLMも“良い/悪いのフィードバックで方策を勾配で更新”する。

おすすめの活用法・注目ポイント

「方策のパラメータを勾配で直接更新/モデルフリー/連続行動に強い」が鉄板。

3.直前に理解(Q&A)

7問

Q1. 方策勾配法とは?最頻出

方策をパラメータ化し、期待収益を最大化するように勾配を用いて方策のパラメータを直接更新するモデルフリー手法。

Q2. 仕組みは?最頻出

報酬の期待値が大きくなる方向(収益の勾配)へ方策を動かす。

Q3. REINFORCEとは?頻出

方策勾配法の代表的なアルゴリズム(Williams、1992)。

Q4. 「価値関数が必要」は正しい?ひっかけ

誤り。価値関数を介さず、方策を直接更新する(モデルフリー)。

Q5. 得意なのは?頻出

連続的な行動空間(離散だけでなく、任意の行動値)。

Q6. 提唱者と年代は?頻出

Williams(1992年)やSuttonら(1999年)

Q7. 位置づけは?親と子

強化学習 ⊃ 方策勾配法。

4. まとめ

方策勾配法=方策をパラメータ化し、期待収益を最大化するように勾配でパラメータを直接更新する手法。

ハッシュタグ #G検定 #生成AIパスポート #方策勾配法 #REINFORCE #強化学習 #方策 #モデルフリー #DX勉強 #資格勉強 #AI基礎