GPT-5.6 SolのAPI・クレジット価格を20%以上引き下げClaude SecurityがMythos 5でGitHubリポジトリをスキャンZero Data Retention継続とPrivate Safety Processingプレビューで安全性を強化ClaudeがGmailでメールを送信しGoogle Driveのファイルを管理できます高リスク訓練の監視を強化しRL訓練を一時停止できます承認済み防御者がGPT-5.6-Cyberで高度な脆弱性調査を進めやすくなりますサイクロン予測で1日以上の余裕を持った対策が可能になります声で話しながら推論やツールを使っても会話が途切れませんAIが長年の数学難問10件に新結果、証明書を公開GPT-5.6 LunaとTerraの価格が80%・20%下がり、高速オプションも追加されますOpus 5が全有料プランとAPIで即利用可能に健康記録を安全に連携し、症状変化や検査結果を文脈で把握できますノートにコードを入れて調べ物と分析を一つにできますGPT-Redでプロンプトインジェクション耐性が大幅向上授業準備をAIで短くしやすくなります会話から資料作成まで、仕事をひと通り速く進めやすくなりますブラウザだけでAI推論を動かして待ち時間を減らせますClaudeの使い方を振り返って無駄を減らせます長い作業を下書きから資料化まで一気に進めやすくなります大きくなるモデルの安全確認ルールを最新版で追えますGPT-5.6 SolのAPI・クレジット価格を20%以上引き下げClaude SecurityがMythos 5でGitHubリポジトリをスキャンZero Data Retention継続とPrivate Safety Processingプレビューで安全性を強化ClaudeがGmailでメールを送信しGoogle Driveのファイルを管理できます高リスク訓練の監視を強化しRL訓練を一時停止できます承認済み防御者がGPT-5.6-Cyberで高度な脆弱性調査を進めやすくなりますサイクロン予測で1日以上の余裕を持った対策が可能になります声で話しながら推論やツールを使っても会話が途切れませんAIが長年の数学難問10件に新結果、証明書を公開GPT-5.6 LunaとTerraの価格が80%・20%下がり、高速オプションも追加されますOpus 5が全有料プランとAPIで即利用可能に健康記録を安全に連携し、症状変化や検査結果を文脈で把握できますノートにコードを入れて調べ物と分析を一つにできますGPT-Redでプロンプトインジェクション耐性が大幅向上授業準備をAIで短くしやすくなります会話から資料作成まで、仕事をひと通り速く進めやすくなりますブラウザだけでAI推論を動かして待ち時間を減らせますClaudeの使い方を振り返って無駄を減らせます長い作業を下書きから資料化まで一気に進めやすくなります大きくなるモデルの安全確認ルールを最新版で追えます
公式発表のみ掲載。噂・リーク・情報商材は除外します。
← 用語集に戻る
用語集AI用語

量子化

Quantization

りょうしか

解説

量子化とは、モデルの重み表現を低ビット化して計算量とメモリを減らし、推論を高速・低コストにする手法です。理解すると調整がしやすくなります。

数百億パラメータのLLMを自分のPCで動かしたい。しかしGPUメモリが足りない。そんな壁にぶつかったとき、解決策となるのが量子化です。量子化(Quantization)とは、モデルの重みパラメータをより少ないビット数で表現することで、メモリ使用量と計算コストを大幅に削減する技術です。

ビット数を減らすとは

通常、LLMの重みは32ビットまたは16ビットの浮動小数点数で保存されています。量子化はこれを8ビット、4ビット、あるいはそれ以下に変換します。たとえば、16ビット→4ビットの量子化では、メモリ使用量が約4分の1になります。70Bパラメータのモデルが、16ビットでは約140GBのメモリを必要としますが、4ビット量子化で約35GBにまで圧縮でき、一般的なGPUでも動作可能になります。

精度への影響

「情報量を減らして品質は落ちないのか」という疑問は当然です。実際、量子化による精度低下は避けられませんが、最新の手法ではその影響は驚くほど小さくなっています。8ビット量子化ではほぼ精度低下なし、4ビットでも多くのタスクで実用的な品質を維持できます。ただし、2ビット以下の極端な量子化では品質の劣化が目立つため、用途に応じたビット数の選択が重要です。

主要な量子化手法

量子化にはいくつかの手法があります。GPTQは学習後の重みをGPUで効率的に量子化する手法で、推論速度に優れます。GGUF(旧GGML)はllama.cppで使われるフォーマットで、CPUでの推論に最適化されており、MacやWindows PCでLLMを動かすときの定番です。AWQはハードウェアを意識した量子化で、GPTQより高速な推論が可能です。bitsandbytesはHugging Face環境で手軽に量子化を適用できるライブラリとして広く使われています。

ローカルLLMの民主化

量子化技術の発展は、LLMのローカル実行を現実的なものにしました。OllamaやLM Studioといったツールを使えば、4ビット量子化されたLlama 3やMistralなどのモデルを、16GBのメモリを搭載した一般的なノートPCでも動かせます。クラウドAPI不要、データを外部に送信する必要もないため、プライバシーを重視する用途やオフライン環境で特に価値があります。量子化は、高性能AIを手元で使える時代を切り開いた重要な技術です。