GPT‑6 Astra 공개: 화면을 조작하는 프런티어 모델, 성능만큼 커진 통제 과제

OpenAI가 컴퓨터 사용·코딩·과학 작업을 강화한 GPT‑6 Astra를 공개하고 ChatGPT와 API, Azure, Bedrock으로 순차 제공한다고 발표했다.

모델이 답변을 넘어 직접 작업하는 단계로

OpenAI는 9월 3일 GPT‑6 Astra를 공개했습니다. 회사 발표에 따르면 Astra는 브라우저와 데스크톱 조작, 소프트웨어 개발, 전문 문서와 과학 작업을 하나의 모델에서 강화했습니다. 제한된 조직부터 시작해 ChatGPT Plus·Pro·Business·Enterprise, OpenAI API, Microsoft Azure와 AWS Bedrock으로 순차 확대됩니다. API 모델명은 gpt-6-astra이며 표준 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러입니다.

OpenAI는 OSWorld 2.0에서 72.6%, Terminal-Bench 4.0에서 57.9%를 보고했습니다. 또한 장문 검색 평가에서 최대 100만 토큰 구간을 제시하고, Codex에서는 압축 전 맥락을 다시 검색하는 실험 기능을 소개했습니다. 이는 채팅 품질만이 아니라 화면 조작, 도구 사용과 장시간 작업 상태 유지가 프런티어 경쟁의 핵심이 됐다는 신호입니다.

높은 점수와 실제 운영은 다르다

평가 대부분은 OpenAI 연구 환경 또는 회사가 구성한 도구·하네스에서 나온 공급사 보고값입니다. 시스템 프롬프트, 실행 권한, 네트워크와 확인 정책이 다른 실제 서비스에서 같은 결과를 보장하지 않습니다. 특히 Astra는 OpenAI의 Preparedness Framework에서 사이버 Critical 기준에 도달했다고 발표돼 고급 작업이 중단되거나 추가 확인을 요구할 수 있습니다.

조직은 벤치마크 순위보다 실제 업무 성공률, 잘못된 클릭과 변경, 사람 승인 횟수, 총 비용과 복구 가능성을 함께 시험해야 합니다. 민감한 시스템에서는 최소 권한, 샌드박스, 목적지 확인과 변경 전 승인 경계가 여전히 필요합니다.

공식 출처