GPT-5.6 SolのAPI・クレジット価格を20%以上引き下げClaude SecurityがMythos 5でGitHubリポジトリをスキャンZero Data Retention継続とPrivate Safety Processingプレビューで安全性を強化ClaudeがGmailでメールを送信しGoogle Driveのファイルを管理できます高リスク訓練の監視を強化しRL訓練を一時停止できます承認済み防御者がGPT-5.6-Cyberで高度な脆弱性調査を進めやすくなりますサイクロン予測で1日以上の余裕を持った対策が可能になります声で話しながら推論やツールを使っても会話が途切れませんAIが長年の数学難問10件に新結果、証明書を公開GPT-5.6 LunaとTerraの価格が80%・20%下がり、高速オプションも追加されますOpus 5が全有料プランとAPIで即利用可能に健康記録を安全に連携し、症状変化や検査結果を文脈で把握できますノートにコードを入れて調べ物と分析を一つにできますGPT-Redでプロンプトインジェクション耐性が大幅向上授業準備をAIで短くしやすくなります会話から資料作成まで、仕事をひと通り速く進めやすくなりますブラウザだけでAI推論を動かして待ち時間を減らせますClaudeの使い方を振り返って無駄を減らせます長い作業を下書きから資料化まで一気に進めやすくなります大きくなるモデルの安全確認ルールを最新版で追えますGPT-5.6 SolのAPI・クレジット価格を20%以上引き下げClaude SecurityがMythos 5でGitHubリポジトリをスキャンZero Data Retention継続とPrivate Safety Processingプレビューで安全性を強化ClaudeがGmailでメールを送信しGoogle Driveのファイルを管理できます高リスク訓練の監視を強化しRL訓練を一時停止できます承認済み防御者がGPT-5.6-Cyberで高度な脆弱性調査を進めやすくなりますサイクロン予測で1日以上の余裕を持った対策が可能になります声で話しながら推論やツールを使っても会話が途切れませんAIが長年の数学難問10件に新結果、証明書を公開GPT-5.6 LunaとTerraの価格が80%・20%下がり、高速オプションも追加されますOpus 5が全有料プランとAPIで即利用可能に健康記録を安全に連携し、症状変化や検査結果を文脈で把握できますノートにコードを入れて調べ物と分析を一つにできますGPT-Redでプロンプトインジェクション耐性が大幅向上授業準備をAIで短くしやすくなります会話から資料作成まで、仕事をひと通り速く進めやすくなりますブラウザだけでAI推論を動かして待ち時間を減らせますClaudeの使い方を振り返って無駄を減らせます長い作業を下書きから資料化まで一気に進めやすくなります大きくなるモデルの安全確認ルールを最新版で追えます
公式発表のみ掲載。噂・リーク・情報商材は除外します。
← 用語集に戻る
用語集AI用語

自動評価

Automated Evaluation

じどうひょうか

解説

自動評価とは、ルールや別モデルを使って出力品質を機械的に測り、素早く改善サイクルを回す評価方法です。理解すると調整がしやすくなります。

モデルを改良するたびに数百件の出力を人に読んでもらうのは、現実的ではありません。開発のスピードに評価が追いつかなくなるからです。自動評価(Automated Evaluation)とは、ルールベースまたはモデルベースの手法で、AIの出力品質をプログラム的にスコアリングする評価手法です。

ルールベースの自動評価

最もシンプルな自動評価は、明確なルールに基づく判定です。たとえば、コード生成であればテストケースの通過率、翻訳であればBLEUスコア(参照訳との一致度)、要約であればROUGEスコア(参照要約との重複率)といった指標が長年使われてきました。これらは計算が高速で再現性が高いという利点がありますが、「正解が一つに定まらない」タスクでは限界があります。自然な会話の良し悪しや、創造的な文章の質は、単純な文字列比較では測れません。

LLM-as-Judge

近年急速に普及しているのが、LLM自体を評価者として使う「LLM-as-Judge」というアプローチです。GPT-4やClaude 3.5などの高性能モデルに、評価基準(ルーブリック)を与えて別のモデルの出力を採点させます。MT-BenchやAlpacaEvalなどの有名なベンチマークでもこの方式が採用されています。

LLM-as-Judgeの利点は、人手評価に近い柔軟な判断が可能でありながら、数千件の出力を数分で評価できるスピードです。プロンプトの変更やモデルの更新のたびに素早くフィードバックを得られるため、開発の反復速度が大幅に向上します。

キャリブレーションの必要性

自動評価を信頼するためには、人手評価との相関を検証するキャリブレーションが不可欠です。LLM-as-Judgeには、長い回答を高く評価しがち(冗長性バイアス)、最初に提示された回答を好みがち(位置バイアス)、自分と同じモデルの出力を優遇しがち(自己バイアス)といった既知の偏りがあります。

これらの偏りを補正するため、評価対象の順序をランダム化する、複数の評価モデルを使って結果を比較する、定期的に人手評価と照合してスコアのずれを確認するといった対策が取られます。

実務での使い分け

現在のベストプラクティスは、日常の開発サイクルでは自動評価を使い、重要なリリース判断には人手評価を併用するという二段構えです。自動評価は「明らかな品質低下を素早く検出する」ことに優れており、人手評価は「微妙な品質差を正確に判定する」ことに優れています。両者を組み合わせることで、開発速度と評価精度の両立が可能になります。