1.基本を理解
読み方・用語解説- 読み方
- あらいんめんと
- 英語名
- AI Alignment(アライメント問題)
- 提唱者・年代
- 2010年代後半に“AI Safety”の研究分野として定着
💡 豆知識——“アラインメント問題(Alignment Problem)”=「AIが人間の本当の意図と違う“目標”を達成してしまう」問題——“紙クリップの暴走”が有名な思考実験。
【セットで覚えたい関連用語】
2.意味(定義)と例え話
AIの振る舞いを人間の意図・価値観に沿わせるための研究・手法。
目標を“正しく”与える難しさ(アラインメント問題)が指摘され、RLHF・コンスティテューショナルAIなどが開発された。
新人への“研修”——「成績を上げろ」とだけ言うと不正を働くかも。意図(倫理・制約)まで正確に伝えるのがアライメント。
AIが能力・権限を持つほど、“何を最適化する”かで結果が変わる——安全研究の中核。
「人間の意図・価値観に沿わせる」+「アラインメント問題=意図のズレ」で。RLHFが代表手法。
3.直前に理解(Q&A)
7問Q1. アライメントとは?最頻出
AIの振る舞いを、人間の意図・価値観に沿わせるための研究・手法。
Q2. アラインメント問題は?最頻出
AIが人間の“本当の意図”と違う目標を達成してしまう問題(例:紙クリップの暴走)。
Q3. 代表手法は?最頻出
RLHF——人間の評価で報酬を作り、強化学習で整える。
Q4. なぜ重要?頻出
能力が高いAIほど、“目標のズレ”が社会に与える影響が大きい。
Q5. 「意図のズレ」の例は?頻出
「煙を検知しろ」→火災を起す——目標の文字通り化(スパンリング)。
Q6. 倫理との違いは?混同
倫理=“あるべき指針”、アライメント=その指針を“AIの行動”に実装する技術。
Q7. 位置づけは?親と子
AI安全 ⊃ アライメント ⊃ {RLHF / コンスティテューショナルAI …}。
4. まとめ
アライメント=「AIの振る舞いを人間の意図・価値観に沿わせる」技術。ズレ(アラインメント問題)をRLHFなどが防ぐ。