말을 끊어도 대화가 이어진다: GPT‑Live‑1 음성 API와 분당 0.05달러

OpenAI가 듣기와 말하기를 동시에 처리하고 복잡한 추론은 백엔드 모델에 위임하는 GPT‑Live‑1을 API로 출시했다.

STT·LLM·TTS의 순차 연결을 줄이는 전이중 모델

OpenAI는 9월 10일 GPT‑Live‑1을 API에 출시했습니다. 모델은 들어오는 음성과 내보내는 음성을 함께 처리해 사용자가 답변 중 끼어들거나 잠시 멈추고 방향을 바꾸는 상황에 대응합니다. 음성 계층은 대화를 계속하면서 복잡한 추론과 도구 호출을 GPT‑6 Astra 같은 백엔드 모델이나 제3자 모델에 위임할 수 있습니다.

회사 발표에는 말투·속도·스타일 제어, 배경 소음과 침묵 처리, 장기 대화, 전화 연결, ASR 전사와 키워드 편향 기능이 포함됩니다. 프런트엔드 음성 계층 가격은 분당 0.05달러이며, 백엔드 모델과 에이전트 하네스 사용료는 별도입니다. OpenAI는 자체 Full Duplex Bench에서 GPT‑Realtime‑2.1보다 30%포인트 개선됐다고 보고했습니다.

분당 가격만으로 실제 통화 비용을 계산하면 안 된다

0.05달러는 음성 프런트엔드 가격입니다. 추론 모델, 도구, 전화망, 기록 저장과 관측 비용이 더해질 수 있습니다. Speak의 끼어들기 감소와 고객사의 코드 감소 수치도 초기 고객·공급사 보고라서 언어, 억양, 소음과 업무 흐름이 다른 환경의 결과를 보장하지 않습니다.

전화 상담에 적용할 때는 녹음·전사 고지, 민감정보 마스킹, 발화자 확인, 잘못 들은 금액·주소의 재확인과 사람 상담원 전환을 함께 설계해야 합니다.

공식 출처