1.基本を理解
読み方・用語解説- 読み方
- いんすとるくとじーぴーてぃー
- 英語名
- InstructGPT(2022年、OpenAI)
- 提唱者・年代
- 2022年——RLHF(人間のフィードバックによる強化学習)で微調整
💡 豆知識——“GPT-3が『うーん、どうだろう』と言うのを、『では、こうします』に変えた”——実質的なChatGPTの準備段階。
【セットで覚えたい関連用語】
2.意味(定義)と例え話
2022年に公開。RLHFで微調整され、人間の指示に従うアシスタントとして振る舞うモデル。
GPT-3の“穴埋め”では指示に従えない——人間の“評価”(どの応答が良いか)で強化学習し、助言型に整えた(2022)。
博識だが“質問クイズ”にしか答えない人を、研修で“相談役”に転職させる——評価基準(人間の好み)で行動を磨く。
LLMを“指示できるアシスタント”にするRLHF——ChatGPT・GPT-3.5の中核技術。
「RLHF(人間のフィードバック)で指示対応」で。アライメント問題の中核例。
3.直前に理解(Q&A)
7問Q1. InstructGPTとは?最頻出
2022年公開。RLHFで微調整され、人間の指示に従うモデル。
Q2. RLHFとは?最頻出
Reinforcement Learning from Human Feedback——人間の評価(好み)で強化学習。
Q3. GPT-3との違いは?最頻出
GPT-3は“次の語穴埋め”、InstructGPTは“指示に従う応答”——RLHFで整えた。
Q4. 手順は?頻出
①人間のラベル(評価)→②報酬モデル学習→③強化学習で最適化。
Q5. アライメントとの関係は?頻出
人間の意図・価値観に沿わせる研究(アライメント)の代表実装。
Q6. 後継は?頻出
GPT-3.5→ChatGPT——RLHF後のモデルが対話サービスに。
Q7. 位置づけは?親と子
GPT系 ⊃ InstructGPT(RLHFで指示特化)。
4. まとめ
InstructGPT=「人間のフィードバック(RLHF)で、指示に従うように微調整したGPT-3」。ChatGPTの中核技術。