大きなコンテキストと低費用は同じではない
GPT‑6 Astraは1,050,000トークンのコンテキストと最大128,000出力トークンを持ちます。大規模コード、契約書群、長時間エージェントの状態を一つの要求で扱えますが、すべて入ることが最も経済的とは限りません。
Standardの100万トークン当たり料金は入力10ドル、cached input 1ドル、cache write 12.50ドル、出力50ドルです。BatchとFlexはStandardの50%、Fastは2倍で、無料API層はありません。
27万2千を超えると全体の料率が変わる
入力が272,000を超えると超過分だけでなく要求全体に入力・キャッシュ2倍、出力1.5倍が適用されます。
| 要求 | 入力料率 | 入力費用 | 出力10K | 合計 |
|---|---|---|---|---|
| 入力250K + 出力10K | $10/M | $2.50 | $0.50 | $3.00 |
| 入力280K + 出力10K | $20/M | $5.60 | $0.75 | $6.35 |
| 入力1M + 出力10K | $20/M | $20.00 | $0.75 | $20.75 |
テキストだけの簡略例で、ツール料金、画像、再試行は除きます。250Kから280Kへの増加は12%ですが、境界を超えるため合計は2倍以上です。
単純に切らず作業構造を変える
固定指示と反復資料はキャッシュし、検索・file toolで必要箇所だけ取り、長い仕事を段階的な要約と検証に分けられます。遅延を許容する処理はBatch・Flexも検討できます。ただし分割で離れた根拠の関係を失う恐れがあるため、品質評価が先です。
大きな窓は常に全部入れる指示ではなく、必要時に広い状態を保つ選択肢です。精度、総費用、遅延、キャッシュ率、272K超過率を一緒に記録すべきです。