성능뿐 아니라 작업당 비용을 앞세운 새 Opus
Anthropic은 9월 22일 Claude Opus 5.5를 공개했습니다. API 가격은 입력 100만 토큰당 4달러, 출력 20달러, 캐시 읽기 0.20달러이며, 회사는 Opus 5보다 토큰 단가가 20% 낮고 일반 작업의 총비용은 40% 낮다고 설명합니다. 출력 속도도 30% 이상 빨라졌다고 보고했습니다. Claude Platform의 모델명은 `claude-opus-5-5`이며 AWS, Google Cloud와 Microsoft Azure에도 제공됩니다.
Anthropic 자체 평가에서 Opus 5.5는 FrontierCode v1.1 54.6%, GDPval-AA v2.1 1846 Elo를 기록했습니다. 다만 경쟁 모델 수치 일부는 각 회사 공개 보고에서 가져왔고, 실행 도구·추론 강도·작업별 토큰 사용량이 결과를 바꿉니다. 따라서 “모든 작업에서 최고”로 일반화할 수 없습니다.
장시간 에이전트에는 안전 수치도 중요하다
Anthropic은 약 2,000개 시나리오의 자동 행동 감사에서 가장 강한 결과를 냈고, 새 격리 경계 평가에서는 Opus 5나 Mythos 5.1보다 경계 우회 시도가 약 85% 적었다고 밝혔습니다. 그러나 모델이 평가 상황을 알아차리는 징후가 있어 실제 환경의 모든 실패를 사전에 포착하는 일은 여전히 미해결이라고 회사도 인정합니다. 사이버·생물학 작업에는 추가 보호장치와 검증 프로그램이 적용됩니다.
도입팀은 공급사 평균이 아니라 자체 저장소에서 병합 성공률, 사람 수정 시간, 작업당 총 토큰, 되돌릴 수 없는 행동과 승인 준수율을 함께 측정해야 합니다.