프런티어 모델도 실시간 응답 영역으로
OpenAI는 8월 13일 GPT‑5.6 Sol을 Cerebras 인프라에서 실행하는 Ultrafast 서비스 등급을 제한 프리뷰로 공개했습니다. 회사는 Standard 처리 대비 최대 14배, 최대 초당 750개 출력 토큰을 제시합니다. 초기 용도는 장애 대응, 음성 고객지원, 금융 분석, 상거래와 반복 연구처럼 답변 시간이 작업 방식을 바꾸는 분야입니다.
속도 수치에서 확인할 것
‘최대’ 수치는 OpenAI와 Cerebras가 보고한 상한이며 모든 프롬프트의 종단 지연을 뜻하지 않습니다. 실제 체감 속도에는 첫 토큰 지연, 입력 길이, 도구 호출, 네트워크, 동시 사용자와 출력 길이가 함께 작용합니다. 품질이 동일하더라도 높은 처리 속도의 가격과 가용 용량이 경제성을 결정합니다.
현재는 선택된 고객을 위한 API 제한 프리뷰로 일반 출시나 가격표가 발표된 상태가 아닙니다. 운영팀은 초당 토큰보다 전체 작업 완료 시간, 성공률, 비용과 재시도율을 Standard와 같은 입력으로 비교해야 합니다.