GPT‑6のキャッシュミスを可視化、長時間エージェントの費用を診断

OpenAIはキャッシュ・ダッシュボード、ミス診断、明示的区切り、事前準備をGPT‑6向けに公開しました。

再利用率と失敗原因を確認

OpenAIは9月22日、GPT‑6のプロンプトキャッシュを更新しました。30分以内に再利用される対象共通接頭辞に割引を適用し、長時間エージェントの指示、ツール定義、会話文脈を再利用します。ダッシュボードはキャッシュ比率を表示し、診断機能はモデル、ツール、設定、入力のどの変更がミスを起こしたかと影響トークンを示します。

明示的な区切り、文脈を壊さない`configuration_update`、定義を削除せず`allowed_tools`で利用範囲を変える方法、共通文脈を事前処理するprewarmingも提供します。

最大90%割引は総費用90%削減ではない

割引はキャッシュ入力読み取りが対象で、出力、書き込み、再試行、ツール費用は残ります。顧客事例の20〜36%削減は個別条件です。安定した指示を先頭、変動データを後方に置き、適中率だけでなく成功タスク総費用、初回応答時間、品質を測るべきです。

公式情報