RLHF
正式名称
Reinforcement Learning from Human Feedback
一言でいうと
人間の評価を利用してAIを調整する方法
初心者向け説明
RLHFでは、
AIが回答
↓
人間が評価
↓
フィードバック
↓
モデルを調整
というように、人間からのフィードバックをモデルの調整に利用します。
ポイント
- Human Feedbackを利用する
- 強化学習と関係する
- 生成AI・LLMの調整などで利用される
関連用語
関連記事
- AI(人工知能)とは?機械学習・ディープラーニング・生成AIまで応用情報向けに理解しよう
🍯 はちみつメモ
RLHF = 人間の評価を使ってAIを調整する