GPT-5.6 SolのAPI・クレジット価格を20%以上引き下げClaude SecurityがMythos 5でGitHubリポジトリをスキャンZero Data Retention継続とPrivate Safety Processingプレビューで安全性を強化ClaudeがGmailでメールを送信しGoogle Driveのファイルを管理できます高リスク訓練の監視を強化しRL訓練を一時停止できます承認済み防御者がGPT-5.6-Cyberで高度な脆弱性調査を進めやすくなりますサイクロン予測で1日以上の余裕を持った対策が可能になります声で話しながら推論やツールを使っても会話が途切れませんAIが長年の数学難問10件に新結果、証明書を公開GPT-5.6 LunaとTerraの価格が80%・20%下がり、高速オプションも追加されますOpus 5が全有料プランとAPIで即利用可能に健康記録を安全に連携し、症状変化や検査結果を文脈で把握できますノートにコードを入れて調べ物と分析を一つにできますGPT-Redでプロンプトインジェクション耐性が大幅向上授業準備をAIで短くしやすくなります会話から資料作成まで、仕事をひと通り速く進めやすくなりますブラウザだけでAI推論を動かして待ち時間を減らせますClaudeの使い方を振り返って無駄を減らせます長い作業を下書きから資料化まで一気に進めやすくなります大きくなるモデルの安全確認ルールを最新版で追えますGPT-5.6 SolのAPI・クレジット価格を20%以上引き下げClaude SecurityがMythos 5でGitHubリポジトリをスキャンZero Data Retention継続とPrivate Safety Processingプレビューで安全性を強化ClaudeがGmailでメールを送信しGoogle Driveのファイルを管理できます高リスク訓練の監視を強化しRL訓練を一時停止できます承認済み防御者がGPT-5.6-Cyberで高度な脆弱性調査を進めやすくなりますサイクロン予測で1日以上の余裕を持った対策が可能になります声で話しながら推論やツールを使っても会話が途切れませんAIが長年の数学難問10件に新結果、証明書を公開GPT-5.6 LunaとTerraの価格が80%・20%下がり、高速オプションも追加されますOpus 5が全有料プランとAPIで即利用可能に健康記録を安全に連携し、症状変化や検査結果を文脈で把握できますノートにコードを入れて調べ物と分析を一つにできますGPT-Redでプロンプトインジェクション耐性が大幅向上授業準備をAIで短くしやすくなります会話から資料作成まで、仕事をひと通り速く進めやすくなりますブラウザだけでAI推論を動かして待ち時間を減らせますClaudeの使い方を振り返って無駄を減らせます長い作業を下書きから資料化まで一気に進めやすくなります大きくなるモデルの安全確認ルールを最新版で追えます
公式発表のみ掲載。噂・リーク・情報商材は除外します。
← 用語集に戻る
用語集AI用語

RLHF

RLHF (Reinforcement Learning from Human Feedback)

ああるえるえいちえふ

解説

RLHFとは、人の好みの評価を使って報酬モデルを作り、強化学習でモデルの振る舞いを整える手法です。理解すると調整がしやすくなります。

LLMは膨大なテキストで学習しますが、それだけでは「人が本当に求めている回答」を返せるとは限りません。文法的に完璧でも、質問の意図を外した冗長な回答や、不適切な内容を生成してしまうことがあります。RLHF(Reinforcement Learning from Human Feedback)とは、人間が「こちらの回答のほうが良い」と判断した比較データを使い、強化学習でモデルの出力を人間の好みに沿うように最適化する手法です。

3つのステップ

RLHFのプロセスは明確に3段階に分かれます。第1段階は教師ありファインチューニング(SFT)で、人手で作成した高品質な「質問→回答」ペアでモデルを微調整し、対話の基本形を学ばせます。第2段階は報酬モデルの訓練です。同じ質問に対してモデルが生成した複数の回答を人間の評価者が比較・ランキングし、そのデータで「どの回答がどれだけ良いか」をスコア化する報酬モデルを構築します。第3段階で、この報酬モデルのスコアを報酬シグナルとして、PPO(Proximal Policy Optimization)というアルゴリズムでLLM全体を強化学習します。PPOは方策の更新幅を制限して学習を安定させる手法で、元のモデルから逸脱しすぎないよう「KLペナルティ」も加えます。

InstructGPTとChatGPTの誕生

RLHFが一躍有名になったのは、2022年にOpenAIが発表したInstructGPTの論文です。GPT-3(1750億パラメータ)にRLHFを適用したInstructGPTは、パラメータ数が100分の1の13億でも、人間の評価でGPT-3を上回るという衝撃的な結果を示しました。モデルの「賢さ」は規模だけでなく、人間のフィードバックの取り込み方で決まることが実証されたのです。ChatGPTはこの技術の発展形であり、RLHFなしには現在の対話体験は実現しませんでした。

課題と新しいアプローチ

RLHFの最大の課題は運用コストの高さです。人間による比較評価データの作成には、1件あたり数ドルのコストが必要です。報酬モデルのスコアだけを最大化する抜け穴を見つけてしまう「reward hacking(報酬ハック)」問題も厄介です。こうした課題から、DPO(Direct Preference Optimization)が2023年に提案されました。DPOは報酬モデルを介さず、人間の比較データから直接モデルを最適化するため、パイプラインが大幅に簡素化されます。さらに、AIが評価を行うRLAIF(AI Feedback)や、2値判定で学習するKTO(Kahneman-Tversky Optimization)なども登場しています。

現在の主要モデルでの採用

現在のChatGPT、Claude、Geminiといった主要LLMは、いずれもRLHFまたはその発展形を採用しています。AnthropicはConstitutional AIとRLHFを組み合わせ、MetaのLlama系列ではRLHFとDPOの両方を活用しています。人間の好みをモデルに反映させるというRLHFの基本思想は、手法が進化しても変わらないAI開発の中核的な考え方です。