GPT-5.6 SolのAPI・クレジット価格を20%以上引き下げClaude SecurityがMythos 5でGitHubリポジトリをスキャンZero Data Retention継続とPrivate Safety Processingプレビューで安全性を強化ClaudeがGmailでメールを送信しGoogle Driveのファイルを管理できます高リスク訓練の監視を強化しRL訓練を一時停止できます承認済み防御者がGPT-5.6-Cyberで高度な脆弱性調査を進めやすくなりますサイクロン予測で1日以上の余裕を持った対策が可能になります声で話しながら推論やツールを使っても会話が途切れませんAIが長年の数学難問10件に新結果、証明書を公開GPT-5.6 LunaとTerraの価格が80%・20%下がり、高速オプションも追加されますOpus 5が全有料プランとAPIで即利用可能に健康記録を安全に連携し、症状変化や検査結果を文脈で把握できますノートにコードを入れて調べ物と分析を一つにできますGPT-Redでプロンプトインジェクション耐性が大幅向上授業準備をAIで短くしやすくなります会話から資料作成まで、仕事をひと通り速く進めやすくなりますブラウザだけでAI推論を動かして待ち時間を減らせますClaudeの使い方を振り返って無駄を減らせます長い作業を下書きから資料化まで一気に進めやすくなります大きくなるモデルの安全確認ルールを最新版で追えますGPT-5.6 SolのAPI・クレジット価格を20%以上引き下げClaude SecurityがMythos 5でGitHubリポジトリをスキャンZero Data Retention継続とPrivate Safety Processingプレビューで安全性を強化ClaudeがGmailでメールを送信しGoogle Driveのファイルを管理できます高リスク訓練の監視を強化しRL訓練を一時停止できます承認済み防御者がGPT-5.6-Cyberで高度な脆弱性調査を進めやすくなりますサイクロン予測で1日以上の余裕を持った対策が可能になります声で話しながら推論やツールを使っても会話が途切れませんAIが長年の数学難問10件に新結果、証明書を公開GPT-5.6 LunaとTerraの価格が80%・20%下がり、高速オプションも追加されますOpus 5が全有料プランとAPIで即利用可能に健康記録を安全に連携し、症状変化や検査結果を文脈で把握できますノートにコードを入れて調べ物と分析を一つにできますGPT-Redでプロンプトインジェクション耐性が大幅向上授業準備をAIで短くしやすくなります会話から資料作成まで、仕事をひと通り速く進めやすくなりますブラウザだけでAI推論を動かして待ち時間を減らせますClaudeの使い方を振り返って無駄を減らせます長い作業を下書きから資料化まで一気に進めやすくなります大きくなるモデルの安全確認ルールを最新版で追えます
公式発表のみ掲載。噂・リーク・情報商材は除外します。
← 用語集に戻る
用語集AI用語

レイテンシ

Latency

れいてんし

解説

レイテンシとは、リクエストしてから回答が返るまでの遅延時間で、体感速度と運用コストに直結します。体験設計で重要になります。

AIチャットに質問を送ってから最初の文字が表示されるまで、数秒間じっと待った経験があるでしょう。あの「待ち時間」がレイテンシです。レイテンシ(Latency)とは、APIリクエストを送信してからレスポンスを受け取るまでの遅延時間のことで、ユーザー体験を左右する重要な性能指標です。

TTFTとTPS

レイテンシを語る上で重要な指標が2つあります。TTFT(Time To First Token)は、リクエストを送ってから最初のトークンが返ってくるまでの時間です。ストリーミング表示ではこれがユーザーの「待った感」に直結します。TPS(Tokens Per Second)は、1秒あたりに生成されるトークン数で、回答全体が表示されるまでの速度を決めます。TTFTが短くTPSが高いモデルが、体感的に「速い」と感じられます。

レイテンシに影響する要因

レイテンシはさまざまな要因で変動します。モデルのサイズが大きいほど計算量が増えるため遅くなります。入力トークン数が多いとプリフィル処理に時間がかかり、TTFTが長くなります。サーバーの負荷状況やネットワーク距離も影響します。また、同じモデルでもピーク時は混雑により数倍のレイテンシになることがあります。

レイテンシを下げる方法

アプリケーション側でレイテンシを改善するには、いくつかの戦略があります。ストリーミングレスポンスを有効にすれば、完全な回答を待たずに逐次表示できるためTTFTの体感が大幅に改善します。プロンプトを短く保つこと、不要なコンテキストを削ることも効果的です。地理的に近いリージョンのエンドポイントを選ぶことで、ネットワークレイテンシも削減できます。

モデル選択とのトレードオフ

一般に、高性能なモデルほどレイテンシが高く、軽量モデルほど高速です。GPT-4oはGPT-4o-miniより遅く、Claude 3.5 SonnetはClaude 3.5 Haikuより遅い傾向があります。すべてのリクエストに最大モデルを使う必要はありません。簡単な質問には軽量モデル、複雑な推論には高性能モデルというルーティングを実装すれば、コストとレイテンシの両方を最適化できます。リアルタイム性が求められるチャットボットでは、レイテンシは最優先の検討事項です。