캐시 적중률을 관찰하고 원인을 찾는다
OpenAI는 9월 22일 GPT‑6 프롬프트 캐싱 개선을 발표했습니다. 같은 지시·도구 정의·대화 문맥을 반복하는 장시간 에이전트가 계산을 재사용하도록, 30분 안에 다시 쓰는 적격 공통 접두사에 캐시 할인을 제공합니다. 새 대시보드는 입력 중 캐시 처리 비율을 보여주고, 진단 도구는 모델·도구·설정·입력 중 무엇이 바뀌어 캐시가 깨졌는지와 영향을 받은 토큰을 표시합니다.
개발자는 명시적 캐시 중단점을 정하고, 기존 문맥을 유지한 채 `configuration_update`로 추론 강도를 바꾸며, 도구 목록을 삭제하는 대신 `allowed_tools`로 호출 가능 범위를 좁힐 수 있습니다. 알려진 공통 문맥을 미리 계산하는 prewarming도 첫 응답 지연을 줄이는 선택지입니다.
최대 할인과 실제 절감액은 다르다
캐시된 입력 토큰은 최대 90% 할인을 받을 수 있지만 전체 비용이 90% 줄어드는 것은 아닙니다. 출력 토큰, 캐시 쓰기, 재시도와 도구 실행 비용은 남습니다. OpenAI가 소개한 고객 사례의 20~36% 비용 감소는 각자의 트래픽 구조에서 나온 결과입니다.
팀은 안정적인 지시와 도구 스키마를 앞에 두고 변하는 사용자 데이터를 뒤에 배치한 뒤, 캐시 적중률뿐 아니라 작업당 총비용·첫 토큰 지연·정답률을 함께 비교해야 합니다.