GPT‑6 Astraの105万トークンにある費用境界:27.2万を超えるとどうなるか

Astraは105万トークンを扱えますが、入力が27万2千を超えると入力・キャッシュ・出力の高い料率がリクエスト全体に適用されます。

大きなコンテキストと低費用は同じではない

GPT‑6 Astraは1,050,000トークンのコンテキストと最大128,000出力トークンを持ちます。大規模コード、契約書群、長時間エージェントの状態を一つの要求で扱えますが、すべて入ることが最も経済的とは限りません。

Standardの100万トークン当たり料金は入力10ドル、cached input 1ドル、cache write 12.50ドル、出力50ドルです。BatchとFlexはStandardの50%、Fastは2倍で、無料API層はありません。

27万2千を超えると全体の料率が変わる

入力が272,000を超えると超過分だけでなく要求全体に入力・キャッシュ2倍、出力1.5倍が適用されます。

要求入力料率入力費用出力10K合計
入力250K + 出力10K$10/M$2.50$0.50$3.00
入力280K + 出力10K$20/M$5.60$0.75$6.35
入力1M + 出力10K$20/M$20.00$0.75$20.75

テキストだけの簡略例で、ツール料金、画像、再試行は除きます。250Kから280Kへの増加は12%ですが、境界を超えるため合計は2倍以上です。

単純に切らず作業構造を変える

固定指示と反復資料はキャッシュし、検索・file toolで必要箇所だけ取り、長い仕事を段階的な要約と検証に分けられます。遅延を許容する処理はBatch・Flexも検討できます。ただし分割で離れた根拠の関係を失う恐れがあるため、品質評価が先です。

大きな窓は常に全部入れる指示ではなく、必要時に広い状態を保つ選択肢です。精度、総費用、遅延、キャッシュ率、272K超過率を一緒に記録すべきです。

公式資料