GPT-5.6 SolのAPI・クレジット価格を20%以上引き下げClaude SecurityがMythos 5でGitHubリポジトリをスキャンZero Data Retention継続とPrivate Safety Processingプレビューで安全性を強化ClaudeがGmailでメールを送信しGoogle Driveのファイルを管理できます高リスク訓練の監視を強化しRL訓練を一時停止できます承認済み防御者がGPT-5.6-Cyberで高度な脆弱性調査を進めやすくなりますサイクロン予測で1日以上の余裕を持った対策が可能になります声で話しながら推論やツールを使っても会話が途切れませんAIが長年の数学難問10件に新結果、証明書を公開GPT-5.6 LunaとTerraの価格が80%・20%下がり、高速オプションも追加されますOpus 5が全有料プランとAPIで即利用可能に健康記録を安全に連携し、症状変化や検査結果を文脈で把握できますノートにコードを入れて調べ物と分析を一つにできますGPT-Redでプロンプトインジェクション耐性が大幅向上授業準備をAIで短くしやすくなります会話から資料作成まで、仕事をひと通り速く進めやすくなりますブラウザだけでAI推論を動かして待ち時間を減らせますClaudeの使い方を振り返って無駄を減らせます長い作業を下書きから資料化まで一気に進めやすくなります大きくなるモデルの安全確認ルールを最新版で追えますGPT-5.6 SolのAPI・クレジット価格を20%以上引き下げClaude SecurityがMythos 5でGitHubリポジトリをスキャンZero Data Retention継続とPrivate Safety Processingプレビューで安全性を強化ClaudeがGmailでメールを送信しGoogle Driveのファイルを管理できます高リスク訓練の監視を強化しRL訓練を一時停止できます承認済み防御者がGPT-5.6-Cyberで高度な脆弱性調査を進めやすくなりますサイクロン予測で1日以上の余裕を持った対策が可能になります声で話しながら推論やツールを使っても会話が途切れませんAIが長年の数学難問10件に新結果、証明書を公開GPT-5.6 LunaとTerraの価格が80%・20%下がり、高速オプションも追加されますOpus 5が全有料プランとAPIで即利用可能に健康記録を安全に連携し、症状変化や検査結果を文脈で把握できますノートにコードを入れて調べ物と分析を一つにできますGPT-Redでプロンプトインジェクション耐性が大幅向上授業準備をAIで短くしやすくなります会話から資料作成まで、仕事をひと通り速く進めやすくなりますブラウザだけでAI推論を動かして待ち時間を減らせますClaudeの使い方を振り返って無駄を減らせます長い作業を下書きから資料化まで一気に進めやすくなります大きくなるモデルの安全確認ルールを最新版で追えます
公式発表のみ掲載。噂・リーク・情報商材は除外します。
← 用語集に戻る
用語集AI用語

セーフティ分類器

Safety Classifier

せえふてぃぶんるいき

解説

セーフティ分類器とは、入力や出力が安全基準に反していないかを判定する検知モデルで、ガードレールの中核になります。安全な運用の基礎になります。

AIチャットに「爆弾の作り方」と入力すると即座に拒否されますが、「危険物の化学反応について教えて」なら回答されることがあります。この微妙な判断を一瞬で行っているのが、セーフティ分類器(Safety Classifier)です。セーフティ分類器とは、AIへの入力や出力が安全基準に違反していないかを検知・分類する専用のモデルで、ガードレールの中核コンポーネントとしてAIシステムの安全性を支えています。

入力と出力の二重チェック

セーフティ分類器は2つの段階で機能します。入力フィルタリングでは、ユーザーのプロンプトがジェイルブレイク攻撃や違法行為の指示を含んでいないかを、メインモデルが処理する前に判定します。出力フィルタリングでは、モデルが生成した回答が安全基準を満たしているかをユーザーに返す前にチェックします。入力側をすり抜けた攻撃にも出力側で対応できるため、この二重構造が重要です。

代表的な実装

多くのセーフティ分類器はBERT系やLLMベースのモデルをファインチューニングして構築されます。OpenAIのModeration APIは、暴力・自傷行為・性的コンテンツ・ヘイトスピーチなど複数カテゴリに対してスコアを返すAPIとして広く使われています。MetaのLlama Guardはプロンプトと応答の両方を評価でき、オープンソースで利用可能な点が注目されています。AnthropicもClaudeの安全性を支える独自の分類システムを運用しています。

誤検知と見逃しのトレードオフ

最大の課題は偽陽性(安全な内容を有害と判定)と偽陰性(有害な内容を見逃す)のバランスです。閾値を厳しくすれば安全性は上がりますが、医療相談や歴史教育など正当な用途まで制限してしまいます。たとえば「自殺予防の相談」が自傷行為として誤ブロックされるケースは実際に問題となっています。逆に閾値を緩くすると、巧妙なプロンプトインジェクションを通してしまいます。

多言語対応と今後の課題

英語以外の言語での精度確保も大きな課題です。日本語のように文脈依存性が高い言語では、同じ表現でも敬語や文脈で有害性の判定が変わることがあります。また、新しい隠語やスラングは日々生まれるため、分類器の継続的な更新が不可欠です。メインモデルの応答速度を損なわないよう、軽量で高速ながら多言語に対応した分類器の開発が活発に進められています。有害性の検出精度を高めながらも、正当な利用を妨げない――このバランスの追求がセーフティ分類器の研究開発の本質です。