1.基本を理解
読み方・用語解説- 読み方
- まるちえーじぇんときょうかがくしゅう
- 英語名
- Multi-Agent Reinforcement Learning(MARL)
- 提唱者・年代
- 強化学習の発展として90年代以降に発展。AlphaGo等で脚光
💡 豆知識——著名な例は“セルフプレイ”——AI同士が練習相手になって戦い続ける方式(AlphaGo、AlphaZero)。
【セットで覚えたい関連用語】
強
強化学習(No.8)報酬で行動を“学ぶ”AI。単一エージェントの基礎。A
AlphaGo将棋・囲碁で人間を超えた、セルフプレイの代表例。A
AIエージェント(No.391)目標を達成する自律型AI——複数連携するとマルチエージェントになる。2.意味(定義)と例え話
一言で言うと?
複数エージェントが協調・競争する強化学習。
背景・歴史的流れ
単体AIの学習が定着したあと、“複数”が同じ空間で互いに影響し合う学習として発展。ゲームAIで注目を集めた。
身近な例え話
一人暗記で勉強する(単体)vs 部活の練習試合でチーム全員が伸びる(複数)——“相手がいる”と学習が加速する。
AIとの関係
ゲーム(囲碁・将棋・e-sports)で人間超えの成果を生んだ“相手役学習”——協調・競争の設計が鍵。
おすすめの活用法・注目ポイント
「複数+協調・競争」で。単一エージェント(一人)との違いと、セルフプレイの具体例をセットで。
3.直前に理解(Q&A)
7問Q1. マルチエージェント強化学習とは?最頻出
複数エージェントが協調・競争する強化学習。
Q2. 強化学習との違いは?最頻出
エージェントが複数いる(環境が動的になる)——単一は一人。
Q3. 有名な手法・例は?最頻出
セルフプレイ(AlphaGo・AlphaZero)——AI同士が対戦して強くなる。
Q4. “協調”と“競争”は?頻出
協調=チームとして全体報酬を最大化、競争=互いを相手に勝率を上げる。
Q5. なぜ難しい?頻出
他エージェントも学習するため環境が“動いた”になる(非定常性)。
Q6. 「エージェント」とは?混同
環境で行動し報酬を得る主体。複数いるとマルチエージェント。
Q7. 位置づけは?親と子
強化学習 ⊃ 単一/マルチエージェント強化学習。
4. まとめ
マルチエージェント強化学習=“複数AIが協調・競争する”強化学習。AlphaGoのセルフプレイが代表例。