割り込み可能な全二重音声:GPT‑Live‑1 APIは1分0.05ドル

聞く・話すを同時処理し、深い推論とツール利用をバックエンドモデルへ委任する音声モデルです。

STT・LLM・TTSの直列処理を減らす

OpenAIは9月10日、GPT‑Live‑1をAPIへ公開しました。入出力音声を同時に扱い、利用者が回答中に割り込み、停止し、方向を変える会話に対応します。音声層は会話を続けながら、深い推論とツール呼び出しをGPT‑6 Astraや他社モデルへ委任できます。

話し方・速度・スタイル、雑音と沈黙、長時間会話、電話、ASR文字起こし、キーワード補正を備えます。音声フロント層は1分0.05ドルで、バックエンドモデルとハーネスは別料金です。OpenAIは自社評価で旧モデルより30ポイント改善したと報告しました。

表示価格は通話総額ではない

推論、ツール、電話網、保存、監視費用が追加されます。割り込みやコード削減の数値も初期顧客・供給側報告で、言語、訛り、騒音の違う環境を保証しません。録音・文字起こしの告知、機密情報の除去、本人確認、金額・住所の復唱、人への引き継ぎが必要です。

公式情報