1.基本を理解
読み方・用語解説- 読み方
- きょうかがくしゅう(RL)
- 英語名
- Reinforcement Learning(RL)
- 提唱者・年代
- 1980〜90年代にリチャード・サットンらにより確立(彼らの教科書が今もバイブル)
💡 豆知識——“強化”するのは“報酬”。報酬をもらえる行動が強化される、という意味。
【セットで覚えたい関連用語】
2.意味(定義)と例え話
AI(エージェント)が環境と相互作用し、報酬と罰則を通じて試行錯誤を繰り返しながら、報酬を最大化する最適な行動を学ぶ手法(ゲームAI・自動運転に活用)。
動物の学習(報酬で行動を強化する“操作条件づけ”)に着想を得て、“正解ラベルがなくても報酬だけで学べる”として発展した。
犬のしつけに似てる。いい行動したらおやつ(報酬)をあげると、犬は試行錯誤しながら“オヤツ最大化”の行動を覚えていくんだ。
AlphaGo(強化学習+ディープラーニング=深層強化学習)、自動運転、ロボティクス、リソース最適化など。
「試行錯誤・報酬・正解ラベル不要・エージェントと環境の相互作用」が得点セット。教師ありとの違いと一緒に押さえて!
3.直前に理解(Q&A)
8問Q1. 強化学習とは?最頻出
エージェント(AI)が環境と相互作用し、報酬と罰則を通じて試行錯誤を繰り返しながら、報酬を最大化する最適な行動(方策)を学ぶ手法。
Q2. 主な構成要素は?最頻出
エージェント(行動する側)、環境(その世界)、報酬(フィードバック)の3つ。
Q3. 教師あり学習との違いは?最頻出
教師ありは「正解ラベル」で学ぶ。強化学習はラベルなしで、行動した後の「報酬」によって試行錯誤し、最適な行動を学ぶ。
Q4. 代表例は?頻出
AlphaGo(強化学習とディープラーニングを組み合わせる深層強化学習)、ゲームAI、自動運転、ロボット制御など。
Q5. 「最適な行動」とは?頻出
将来得られる累積報酬を最大化する方策(policy)。目の前だけじゃなく“将来の総利益”を見る。
Q6. 「強化学習では正解ラベルを準備する」は正しい?ひっかけ
誤り。強化学習は報酬を使う。正解ラベルを使うのは教師あり学習。
Q7. 強化学習と教師なし学習の違いは?混同注意
教師なしはデータ自体の構造を見つけ、環境との相互作用や報酬はしない。強化学習は環境との相互作用と報酬で“行動”を学ぶ。
Q8. 機械学習内の位置づけは?親と子
機械学習の3大分類(教師あり/教師なし/強化学習)の一つ。
4. まとめ
強化学習は、エージェントが環境と報酬で試行錯誤し、報酬を最大化する行動を学ぶ手法。AlphaGoが代表。