GPT‑6 Astra 105만 토큰의 함정: 긴 문서를 한 번에 넣으면 비용은 얼마나 늘어날까?

Astra는 105만 토큰을 받을 수 있지만 입력이 27만2천 토큰을 넘으면 요청 전체의 입력·캐시·출력 요율이 높아진다.

큰 컨텍스트와 낮은 비용은 같은 말이 아니다

GPT‑6 Astra는 최대 1,050,000토큰의 컨텍스트와 128,000토큰의 최대 출력을 지원합니다. 대규모 코드베이스, 계약서 묶음이나 장기 에이전트 상태를 한 요청에서 다룰 여지가 커졌지만, 수용 가능하다는 사실이 항상 가장 경제적인 설계라는 뜻은 아닙니다.

OpenAI의 표준 API 요금은 100만 토큰당 입력 10달러, 캐시 입력 1달러, 캐시 쓰기 12.50달러, 출력 50달러입니다. Batch와 Flex는 Standard의 50%, Fast는 해당 요율의 2배입니다. 무료 API 계층은 지원되지 않습니다.

27만2천 토큰을 넘으면 요청 전체가 바뀐다

입력이 272,000토큰을 초과하면 초과분만이 아니라 해당 요청 전체에 입력·캐시 2배와 출력 1.5배 요율이 적용됩니다. 단순화한 Standard 예시는 다음과 같습니다.

요청적용 입력 요율입력 비용출력 1만 토큰 비용합계
입력 250K + 출력 10K$10/M$2.50$0.50$3.00
입력 280K + 출력 10K$20/M$5.60$0.75$6.35
입력 1M + 출력 10K$20/M$20.00$0.75$20.75

표는 도구 호출료, 이미지 입력과 재시도를 제외한 텍스트 예시입니다. 250K에서 280K로 입력량은 12% 늘지만 경계를 넘으면서 예시 합계는 두 배 이상이 됩니다.

무조건 잘라내기보다 작업 구조를 바꾼다

비용을 줄이려면 고정 시스템 지침과 반복 자료는 프롬프트 캐시를 활용하고, 원문 전체 대신 검색·파일 도구로 필요한 구간을 가져오며, 긴 업무를 단계별 요약과 검증으로 나눌 수 있습니다. 지연 허용 작업은 Batch·Flex 대상인지 검토합니다. 다만 문서를 나누면 서로 먼 근거의 연결을 놓칠 수 있으므로 정확도 평가가 먼저입니다.

Astra의 큰 컨텍스트는 “항상 전부 넣으라”는 신호가 아니라, 필요할 때 더 넓은 작업 상태를 유지할 선택지입니다. 운영에서는 요청당 정확도, 총비용, 지연, 캐시 적중률과 272K 경계 초과 비율을 함께 기록해야 합니다.

공식 자료