무엇을 실험했나
OpenAI는 7월 29일 ARC-AGI-3의 2D 퍼즐 게임에서 GPT-5.6 Sol이 낮은 점수를 받은 원인을 분석했습니다. ARC-AGI-3는 에이전트가 명시적인 규칙 없이 낯선 게임을 탐색하고 행동 결과를 통해 규칙을 학습하는 평가입니다.
기본 실행기는 매 행동 뒤 모델의 비공개 reasoning을 버렸고, 문맥이 길어지면 오래된 행동을 잘라냈습니다. OpenAI는 이를 Responses API 기반 실행기로 바꾸어 이전 response ID를 통한 reasoning 유지와 오래된 문맥을 요약하는 compaction을 활성화했습니다.
발표된 결과
OpenAI 보고에서 GPT-5.6 Sol은 공식 실행기로 공개 세트 RHAE 13.3%를 기록했지만 두 설정을 적용한 실행기에서는 38.3%를 기록했습니다. 출력 토큰은 약 6분의 1로 줄었습니다. 회사가 공식 플레이 로그로 추정한 평균 인간 점수는 48%였습니다.
모델이 매 행동마다 게임을 처음부터 다시 해석하지 않고 이전 계획과 관찰을 이어받은 것이 차이를 만들었다는 설명입니다. 단순한 rolling truncation 대신 compaction을 사용하면 초반에 배운 규칙과 실패 기록도 더 오래 보존할 수 있었습니다.
왜 중요한가
벤치마크 점수는 모델 가중치만 측정하지 않습니다. API 설정, 도구, 문맥 관리와 실행기 설계까지 함께 측정합니다. 서로 다른 모델을 비교할 때 한쪽의 reasoning 메시지만 폐기하거나 제품 환경과 다른 문맥 정책을 쓰면 순위가 크게 달라질 수 있습니다.
개발자에게는 장기 에이전트의 상태를 무조건 잘라내기보다 목표, 관찰, 실패와 결정 근거를 압축해 보존하고 실제 업무 성공률과 비용을 함께 측정해야 한다는 교훈을 줍니다.
확인할 한계
이는 OpenAI가 자사 모델과 API를 사용해 수행한 공급사 실험입니다. 공개 세트와 특정 실행기에서 나온 결과이며 다른 모델·업무에 같은 배율이 재현된다고 볼 수 없습니다. 모델 능력 비교에서는 실행기 설정을 공개하고 공통 조건과 제품 최적 조건을 나누어 보고할 필요가 있습니다.