AI音声

OpenAI、自然なリアルタイム音声エージェント向けGPT-Live-1を発表

API向けGPT-Live-1は、低遅延で割り込みに対応する音声体験の構築を支援する。

公開日 更新日
OpenAIGPT-Live-1音声AIRealtime API

OpenAIは9月10日、APIでリアルタイム音声エージェントを構築する開発者向けに、音声特化モデルGPT-Live-1を発表した。狙いは、音声AIで最も難しい領域である低遅延、割り込みへの対応、自然な会話のリズムだ。カスタマーサポート、営業、コーチング、対話型アシスタントでは、数秒の沈黙やぎこちない応答がすぐに体験を壊す。OpenAIは、GPT-Live-1をRealtime APIで提供し、文字起こし、テキスト推論、音声合成を別々に連結する方式ではなく、ネイティブな音声対音声のやり取りを目指すとしている。

この設計の違いは大きい。多くの音声ボットは、ユーザーの発話をテキスト化し、そのテキストを言語モデルに送り、最後に返答を音声へ戻す。各段階で遅延が増え、声の調子、間、会話上の手がかりが失われやすい。音声対音声モデルなら、こうした情報を同じシステム内でより多く扱える。OpenAIは、GPT-Live-1がユーザーの割り込みを認識し、より会話的なテンポで応答し、表現力のある音声を支援できると説明している。

企業側の用途は明確だ。AIエージェントに電話応対、見込み客の確認、予約、トラブルシューティング、人間への引き継ぎを任せたい企業は多い。音声では遅延が特に目立つ。テキストチャットで許容される待ち時間も、電話では故障のように感じられる。GPT-Live-1がターンテイキングを自然にできれば、固定的な電話メニューをより柔軟なエージェントへ置き換える道が開く。

OpenAIは開発効率も強調している。モデルが対話ループを直接扱うため、音声エージェント実装のコード量を減らせるという。ツール呼び出しにも対応し、通話中に注文確認、記録更新、会議予約、アカウント情報取得などを行える。ただしその分、権限範囲、同意、ログ、秘密情報、人間へのエスカレーションをどう管理するかが重要になる。

音声AI市場は競争が激しくなっている。信頼される製品には、心地よい声だけでなく、雑音やアクセントへの強さ、厳格な権限、失敗時の自然な退避、AIと話していることの明確な開示が必要だ。