AI要約OpenAI機能アップデート23:57
AIが複数ソースを照合して要約
Responses APIと推論保持・圧縮でベンチマークスコアが3倍になります
API開発者はResponses APIと推論保持設定でモデル性能を効率的に高められます。
参照確認
参照ソース 2件
参照ソース
要点整理
- 1Responses API使用で推論保持が可能
- 2コンテキスト圧縮によりトークン効率向上
- 3ARC-AGI-3スコア188%向上を実証
OpenAIはARC-AGI-3ベンチマークで、Responses APIを使い推論を保持しコンテキストを圧縮する設定を適用しました。これによりGPT-5.6 Solのスコアが188%向上し、出力トークンも6分の1に減りました。標準ハーネスでは推論が破棄されコンテキストが埋まると以前の学習が失われていましたが、この変更でモデルが蓄積した知識を活かせます。API開発者は自社製品と同じ設定を採用することで実運用性能を高められます。
何が起きたか
OpenAIがARC-AGI-3ベンチマークのハーネスをResponses APIに切り替え、推論保持とコンテキスト圧縮を有効化しました。これによりGPT-5.6 Solのスコアが大幅に向上しました。
影響
APIユーザーは同じ設定を採用することで、長期エージェントタスクでの性能向上とトークン削減が期待できます。ベンチマーク結果が設定依存である点も明らかになりました。
hayamiの重要度メモ
公式X投稿とブログリンクありで実務向けAPI設定の具体例を示し、開発者の再現可能性が高いためP2。